این نسخه که در 30 جولای 2026 اعلام شد، بر روی یک مدل بینایی-زبان-عمل (VLA) متمرکز است که آنچه را که یک ربات می بیند و می شنود به دستورات دقیق موتور تبدیل می کند. DeepMind آن را به عنوان لایه هوشی برای رباتیک همه منظوره توصیف می کند و این شرکت راه اندازی را به عنوان نقطه عطفی در بیرون آوردن هوش مصنوعی از پنجره های چت و به دنیای فیزیکی قرار داد. برای اطلاعات بیشتر در مورد فشار صنعت گسترده تر به سمت هوش مصنوعی تجسم یافته، [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) ما را دنبال کنید.
سه مدل، یک سیستم
DeepMind سه مدل مکمل را در مجموعه Gemini Robotics 2 عرضه کرد:
- Gemini Robotics 2 - مدل VLA شاخص که بینایی و زبان را به کنترل حرکتی ترجمه می کند و به ربات امکان می دهد تا اقدامات فیزیکی انجام دهد.
- Gemini Robotics ER 2 - یک مدل استدلال مجسم که قادر به درک فضاهای فیزیکی و تولید طرح های دقیق و چند مرحله ای است که با انسان ها و سایر ربات ها هماهنگ است.
- Gemini Robotics On-Device 2 - یک نسخه سبک وزن از مدل VLA بهینه شده برای اجرای محلی بر روی سخت افزار رباتیک، کاهش وابستگی به اتصال ابری.
با توجه به وبلاگ DeepMind، هر مدل یک نقش تخصصی دارد اما این سه مدل به گونه ای طراحی شده است که به عنوان یک سیستم یکپارچه واحد عمل کند. مدل VLA اقدامات بلادرنگ را انجام میدهد، مدل ER برنامهریزی سطح بالاتر را مدیریت میکند، و نوع روی دستگاه پاسخهای با تأخیر کم را در خود ربات فعال میکند.
از پاها تا نوک انگشتان
قابل توجه ترین ادعا در این اطلاعیه چیزی است که DeepMind آن را کنترل هوشمند کل بدن می نامد. به جای آموزش ربات برای تکرار یک حرکت، Gemini Robotics 2 برای فرمان دادن به کل بدن انسان نما - از پاها تا نوک انگشتان - طراحی شده است که امکان انجام حرکات کامل مانند انسان از جمله خم شدن، رسیدن و تعادل را فراهم می کند.
DeepMind چندین معیار مهارت را برجسته کرده است. در نمایشها، روباتهایی که از این مدل نیرو میگیرند نشان داده شدند که در لامپها پیچ میخورند، گرهها را میبندند و سایر اقدامات ظریفی را انجام میدهند که نیاز به کنترل موتور خوب دارند. این آزمایشگاه گفت که این سیستم به سطح جدیدی از مهارت دست می یابد که به ربات ها اجازه می دهد وظایفی را که نیاز به ظرافت واقعی دارند به جای تکرار بی رحمانه انجام دهند.
این شرکت همچنین بر سازگاری تأکید کرد. DeepMind گفت که Gemini Robotics 2 را می توان تنها در چند ساعت با هر ربات دو بازویی تطبیق داد، به این معنی که همان هوش زیربنایی می تواند از یک بازوی رومیزی تا یک انسان نما پیچیده بدون چرخه کامل بازآموزی مقیاس شود. این تعمیم یک انحراف قابل توجه از روباتیک معمولی است، که در آن هر ماشین معمولاً به نرم افزار هدفمند نیاز دارد.
روبات ها با هم کار می کنند
یکی دیگر از قابلیت های سرفصل، همکاری چند روباتی است. DeepMind گفت Gemini Robotics 2 از سناریوهایی پشتیبانی می کند که در آن دو ربات با هم در یک کار واحد کار می کنند و کار را در یک فضای فیزیکی مشترک تقسیم می کنند. مدل ER 2 هماهنگی را انجام می دهد - استدلال در مورد محیط، ترسیم یک توالی چند مرحله ای، و تخصیص مراحل بین ماشین ها.
در یکی از نمایشهایی که این شرکت به آن اشاره کرد، یک جفت ربات برای تمیز کردن یک اتاق با یکدیگر همکاری کردند و به جای برخورد با یکدیگر، کار را تقسیم کردند. DeepMind این را به عنوان شواهد اولیه نشان داد که هوش مصنوعی می تواند نه تنها اقدامات فردی، بلکه هماهنگی چندین عامل را در دنیای واقعی مدیریت کند.
تعاملی و آموزش پذیر
فراتر از عملکرد مستقل، مدل ها به گونه ای طراحی شده اند که تعاملی باشند. Gemini Robotics 2 میتواند رویکرد خود را در حین انجام یک عمل توضیح دهد و کاربران میتوانند با استفاده از زبان روزمره به جای دستورات فنی، ربات را در وسط کار تغییر مسیر دهند. DeepMind گفت که این باعث می شود این پلت فرم برای آموزش ربات ها در محیط های فرار یا خطرناک که در آن اپراتورهای انسانی نیاز به تنظیم برنامه ها در پرواز دارند، مناسب باشد.
چرا مهم است
پرتاب یک مسابقه انساننما-رباتیک شلوغ را تشدید میکند. شرکتهایی از جمله Figure، Boston Dynamics و Tesla برای تجاریسازی ماشینهای پیادهروی و کار به رقابت پرداختهاند، در حالی که سازندگان تراشه مانند Nvidia سرمایهگذاری زیادی در زیرساختهای شبیهسازی و محاسباتی که هوش مصنوعی فیزیکی به آن نیاز دارد، کردهاند.
شرط DeepMind این است که یک لایه هوشی همهمنظوره - لایهای که در مورد جهان فیزیکی به همان روشی که یک چت بات درباره متن استدلال میکند - میتواند جایگزین نرمافزار سفارشی و محدودی شود که دههها رباتیک صنعتی را تعریف کرده است. اگر این سیستم واقعاً بتواند در چند ساعت با هر تجسمی سازگار شود، مانع تولیدکنندگان و محققانی خواهد شد که به دنبال استقرار روباتهای توانمند بدون شروع هر بار از ابتدا هستند.
این شرکت گفت که با شرکای سخت افزاری قابل اعتماد برای گسترش پلت فرم کار می کند و اسناد مسئولیت و ایمنی را در کنار انتشار منتشر کرد. سوالاتی در مورد نحوه عملکرد این مدلها خارج از نمایشهای کنترلشده و اینکه چگونه کنترل انساننمای کل بدن میتواند به سرعت قابل اعتماد و استقرار در دنیای واقعی تبدیل شود، باقی میماند.
با این حال، گستردگی راهاندازی - حرکت کل بدن، استدلال چند مرحلهای، کارایی روی دستگاه و هماهنگی چند عاملی در یک خانواده محصول - نشان میدهد که گوگل قصد دارد بازیگر اصلی در همگرایی مدلهای بزرگ هوش مصنوعی و ماشینهای فیزیکی باشد.
از هوش مصنوعی جلوتر بمانید
مرز رباتیک به سرعت در حال حرکت است و AI Buzz Wire همه پیشرفت های مهم را دنبال می کند. [ اخبار هوش مصنوعی را بیشتر بخوانید] (https://aibuzzwire.news) برای پوشش مداوم نسخه های مدل، پیشرفت های سخت افزاری و تغییرات صنعت.
آخرین پیشرفتهای هوش مصنوعی را کاوش کنید →