Оголошений 30 липня 2026 року випуск зосереджений на моделі зорової мови-дій (VLA), яка перетворює те, що робот бачить і чує, на точні рухові команди. DeepMind описує його як інтелектуальний рівень для робототехніки загального призначення, і компанія позиціонує запуск як поворотний момент у виведенні ШІ з вікон чату у фізичний світ. Щоб дізнатися більше про ширший рух галузі до втіленого штучного інтелекту, слідкуйте за нашими найновішими новинами про штучний інтелект.
Три моделі, одна система
DeepMind поставив три взаємодоповнюючі моделі в лінійці Gemini Robotics 2:
- Gemini Robotics 2 — флагманська модель VLA, яка перетворює зір і мову на керування двигуном, дозволяючи роботу виконувати фізичні дії.
- Gemini Robotics ER 2 — модель втіленого міркування, здатна розуміти фізичний простір і створювати детальні багатоетапні плани, які координуються з людьми та іншими роботами.
- Gemini Robotics On-Device 2 — спрощена версія моделі VLA, оптимізована для локальної роботи на роботизованому обладнанні, зменшуючи залежність від підключення до хмари.
Відповідно до блогу DeepMind, кожна модель має роль спеціаліста, але тріо розроблено для роботи як єдина інтегрована система. Модель VLA керує діями в режимі реального часу, модель ER керує плануванням вищого рівня, а варіант на пристрої забезпечує низьку затримку відповідей самого робота.
Від ніг до кінчиків пальців
Найяскравішим твердженням в оголошенні є те, що DeepMind називає інтелектуальним керуванням усім тілом. Замість того, щоб навчати робота повторювати один рух, Gemini Robotics 2 розроблено для керування всім гуманоїдним тілом — від ніг до кінчиків пальців — забезпечуючи повний діапазон людських рухів, включаючи згинання, потягнення та балансування.
DeepMind виділив кілька контрольних показників спритності. Під час демонстрацій показали, що роботи, керовані цією моделлю, вкручують лампочки, зав’язують вузли та виконують інші делікатні дії, які вимагають тонкого контролю моторики. Лабораторія заявила, що система досягає нового рівня спритності, що дозволяє роботам виконувати завдання, які вимагають справжньої витонченості, а не грубого повторення.
Компанія також підкреслила адаптивність. За словами DeepMind, Gemini Robotics 2 можна адаптувати до будь-якого робота з двома руками всього за кілька годин, що означає, що той самий базовий інтелект може масштабуватися від настільної руки до складного гуманоїда без повного циклу перенавчання. Це узагальнення є значним відхиленням від традиційної робототехніки, де для кожної машини зазвичай потрібне спеціально створене програмне забезпечення.
Роботи, що працюють разом
Ще однією головною можливістю є співпраця кількох роботів. DeepMind каже, що Gemini Robotics 2 підтримує сценарії, в яких два роботи працюють разом над одним завданням, розподіляючи роботу в спільному фізичному просторі. Модель ER 2 керує координацією — міркуваннями про середовище, плануванням багатокрокової послідовності та розподілом кроків між машинами.
В одній демонстрації, яку цитує компанія, пара роботів разом прибирала кімнату, розподіляючи роботу, а не стикаючись один з одним. DeepMind назвав це раннім доказом того, що ШІ може керувати не лише окремими діями, але й оркестровкою кількох агентів у реальному світі.
Інтерактивний і з можливістю навчання
Окрім автономної роботи, моделі створені для інтерактивності. Gemini Robotics 2 може пояснити свій підхід під час виконання дії, і користувачі можуть перенаправляти робота в середині завдання, використовуючи повсякденну мову, а не технічні команди. У DeepMind кажуть, що це робить платформу ідеальною для навчання роботів у нестабільних або небезпечних середовищах, де людям-операторам потрібно коригувати плани на льоту.
Чому це важливо
Запуск активізує і без того багатолюдну гонку гуманоїдів і робототехніки. Такі компанії, як Figure, Boston Dynamics і Tesla, змагалися за комерціалізацію крокуючих робочих машин, тоді як виробники чіпів, такі як Nvidia, інвестували значні кошти в моделювання та обчислювальну інфраструктуру, яка потрібна фізичному ШІ.
DeepMind робить ставку на те, що єдиний рівень інтелекту загального призначення — такий, який міркує про фізичний світ так, як чат-бот міркує про текст — може замінити індивідуальне вузьке програмне забезпечення, яке десятиліттями визначало промислову робототехніку. Якщо система справді зможе адаптуватися до будь-якого варіанту за кілька годин, це знизить бар’єр для виробників і дослідників, які прагнуть розгортати потужних роботів, не починаючи щоразу з нуля.
Компанія заявила, що співпрацює з надійними партнерами з обладнання для розширення платформи, і опублікувала документацію про відповідальність і безпеку разом із випуском. Залишаються питання про те, як ці моделі працюють поза контрольованими демонстраціями та як швидко управління гуманоїдом усього тіла може перетворитися на надійне розгортання в реальному світі.
Тим не менш, широта запуску — рухи всього тіла, багатоетапне міркування, ефективність на пристрої та багатоагентна координація в одній сім’ї продуктів — сигналізує про те, що Google має намір бути головним гравцем у конвергенції великих моделей ШІ та фізичних машин.
Будьте попереду ШІ
Кордон робототехніки швидко рухається, і AI Buzz Wire відслідковує всі важливі розробки. Читайте більше новин AI для безперервного висвітлення випусків моделей, апаратних проривів і змін у галузі.
Ознайомтеся з останніми розробками ШІ →