Google DeepMind Gemini Robotics 2 را راه‌اندازی کرده است، خانواده‌ای از مدل‌های فیزیکی با هوش مصنوعی که آزمایشگاه می‌گوید می‌تواند به‌طور هوشمند هر نوع ربات را کنترل کند - از ایستگاه‌های کاری دو بازویی گرفته تا بدن‌های کامل انسان‌نما - که جاه‌طلبانه‌ترین فشار این شرکت تاکنون به دنیای ماشین‌های متحرک را نشان می‌دهد.

این نسخه که در 30 جولای 2026 اعلام شد، بر روی یک مدل بینایی-زبان-عمل (VLA) متمرکز است که آنچه را که یک ربات می بیند و می شنود به دستورات دقیق موتور تبدیل می کند. DeepMind آن را به عنوان لایه هوشی برای رباتیک همه منظوره توصیف می کند و این شرکت راه اندازی را به عنوان نقطه عطفی در بیرون آوردن هوش مصنوعی از پنجره های چت و به دنیای فیزیکی قرار داد. برای اطلاعات بیشتر در مورد فشار صنعت گسترده تر به سمت هوش مصنوعی تجسم یافته، [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) ما را دنبال کنید.

سه مدل، یک سیستم

DeepMind سه مدل مکمل را در مجموعه Gemini Robotics 2 عرضه کرد:

  • Gemini Robotics 2 - مدل VLA شاخص که بینایی و زبان را به کنترل حرکتی ترجمه می کند و به ربات امکان می دهد تا اقدامات فیزیکی انجام دهد.
  • Gemini Robotics ER 2 - یک مدل استدلال مجسم که قادر به درک فضاهای فیزیکی و تولید طرح های دقیق و چند مرحله ای است که با انسان ها و سایر ربات ها هماهنگ است.
  • Gemini Robotics On-Device 2 - یک نسخه سبک وزن از مدل VLA بهینه شده برای اجرای محلی بر روی سخت افزار رباتیک، کاهش وابستگی به اتصال ابری.

با توجه به وبلاگ DeepMind، هر مدل یک نقش تخصصی دارد اما این سه مدل به گونه ای طراحی شده است که به عنوان یک سیستم یکپارچه واحد عمل کند. مدل VLA اقدامات بلادرنگ را انجام می‌دهد، مدل ER برنامه‌ریزی سطح بالاتر را مدیریت می‌کند، و نوع روی دستگاه پاسخ‌های با تأخیر کم را در خود ربات فعال می‌کند.

از پاها تا نوک انگشتان

قابل توجه ترین ادعا در این اطلاعیه چیزی است که DeepMind آن را کنترل هوشمند کل بدن می نامد. به جای آموزش ربات برای تکرار یک حرکت، Gemini Robotics 2 برای فرمان دادن به کل بدن انسان نما - از پاها تا نوک انگشتان - طراحی شده است که امکان انجام حرکات کامل مانند انسان از جمله خم شدن، رسیدن و تعادل را فراهم می کند.

DeepMind چندین معیار مهارت را برجسته کرده است. در نمایش‌ها، روبات‌هایی که از این مدل نیرو می‌گیرند نشان داده شدند که در لامپ‌ها پیچ می‌خورند، گره‌ها را می‌بندند و سایر اقدامات ظریفی را انجام می‌دهند که نیاز به کنترل موتور خوب دارند. این آزمایشگاه گفت که این سیستم به سطح جدیدی از مهارت دست می یابد که به ربات ها اجازه می دهد وظایفی را که نیاز به ظرافت واقعی دارند به جای تکرار بی رحمانه انجام دهند.

این شرکت همچنین بر سازگاری تأکید کرد. DeepMind گفت که Gemini Robotics 2 را می توان تنها در چند ساعت با هر ربات دو بازویی تطبیق داد، به این معنی که همان هوش زیربنایی می تواند از یک بازوی رومیزی تا یک انسان نما پیچیده بدون چرخه کامل بازآموزی مقیاس شود. این تعمیم یک انحراف قابل توجه از روباتیک معمولی است، که در آن هر ماشین معمولاً به نرم افزار هدفمند نیاز دارد.

روبات ها با هم کار می کنند

یکی دیگر از قابلیت های سرفصل، همکاری چند روباتی است. DeepMind گفت Gemini Robotics 2 از سناریوهایی پشتیبانی می کند که در آن دو ربات با هم در یک کار واحد کار می کنند و کار را در یک فضای فیزیکی مشترک تقسیم می کنند. مدل ER 2 هماهنگی را انجام می دهد - استدلال در مورد محیط، ترسیم یک توالی چند مرحله ای، و تخصیص مراحل بین ماشین ها.

در یکی از نمایش‌هایی که این شرکت به آن اشاره کرد، یک جفت ربات برای تمیز کردن یک اتاق با یکدیگر همکاری کردند و به جای برخورد با یکدیگر، کار را تقسیم کردند. DeepMind این را به عنوان شواهد اولیه نشان داد که هوش مصنوعی می تواند نه تنها اقدامات فردی، بلکه هماهنگی چندین عامل را در دنیای واقعی مدیریت کند.

تعاملی و آموزش پذیر

فراتر از عملکرد مستقل، مدل ها به گونه ای طراحی شده اند که تعاملی باشند. Gemini Robotics 2 می‌تواند رویکرد خود را در حین انجام یک عمل توضیح دهد و کاربران می‌توانند با استفاده از زبان روزمره به جای دستورات فنی، ربات را در وسط کار تغییر مسیر دهند. DeepMind گفت که این باعث می شود این پلت فرم برای آموزش ربات ها در محیط های فرار یا خطرناک که در آن اپراتورهای انسانی نیاز به تنظیم برنامه ها در پرواز دارند، مناسب باشد.

چرا مهم است

پرتاب یک مسابقه انسان‌نما-رباتیک شلوغ را تشدید می‌کند. شرکت‌هایی از جمله Figure، Boston Dynamics و Tesla برای تجاری‌سازی ماشین‌های پیاده‌روی و کار به رقابت پرداخته‌اند، در حالی که سازندگان تراشه مانند Nvidia سرمایه‌گذاری زیادی در زیرساخت‌های شبیه‌سازی و محاسباتی که هوش مصنوعی فیزیکی به آن نیاز دارد، کرده‌اند.

شرط DeepMind این است که یک لایه هوشی همه‌منظوره - لایه‌ای که در مورد جهان فیزیکی به همان روشی که یک چت بات درباره متن استدلال می‌کند - می‌تواند جایگزین نرم‌افزار سفارشی و محدودی شود که دهه‌ها رباتیک صنعتی را تعریف کرده است. اگر این سیستم واقعاً بتواند در چند ساعت با هر تجسمی سازگار شود، مانع تولیدکنندگان و محققانی خواهد شد که به دنبال استقرار روبات‌های توانمند بدون شروع هر بار از ابتدا هستند.

این شرکت گفت که با شرکای سخت افزاری قابل اعتماد برای گسترش پلت فرم کار می کند و اسناد مسئولیت و ایمنی را در کنار انتشار منتشر کرد. سوالاتی در مورد نحوه عملکرد این مدل‌ها خارج از نمایش‌های کنترل‌شده و اینکه چگونه کنترل انسان‌نمای کل بدن می‌تواند به سرعت قابل اعتماد و استقرار در دنیای واقعی تبدیل شود، باقی می‌ماند.

با این حال، گستردگی راه‌اندازی - حرکت کل بدن، استدلال چند مرحله‌ای، کارایی روی دستگاه و هماهنگی چند عاملی در یک خانواده محصول - نشان می‌دهد که گوگل قصد دارد بازیگر اصلی در همگرایی مدل‌های بزرگ هوش مصنوعی و ماشین‌های فیزیکی باشد.

از هوش مصنوعی جلوتر بمانید

مرز رباتیک به سرعت در حال حرکت است و AI Buzz Wire همه پیشرفت های مهم را دنبال می کند. [ اخبار هوش مصنوعی را بیشتر بخوانید] (https://aibuzzwire.news) برای پوشش مداوم نسخه های مدل، پیشرفت های سخت افزاری و تغییرات صنعت.

آخرین پیشرفت‌های هوش مصنوعی را کاوش کنید →