В основе этой версии, анонсированной 30 июля 2026 года, лежит модель «зрение-язык-действие» (VLA), которая преобразует то, что видит и слышит робот, в точные двигательные команды. DeepMind описывает его как интеллектуальный уровень для робототехники общего назначения, и компания позиционирует запуск как поворотный момент в выводе ИИ из окон чата в физический мир. Чтобы узнать больше о более широком стремлении отрасли к внедрению искусственного интеллекта, следите за нашими последними новостями об искусственном интеллекте.
Три модели, одна система
DeepMind поставила три взаимодополняющие модели в линейке Gemini Robotics 2:
- Gemini Robotics 2 — флагманская модель VLA, которая преобразует зрение и язык в управление моторикой, позволяя роботу выполнять физические действия.
- Gemini Robotics ER 2 — модель воплощенного рассуждения, способная понимать физические пространства и создавать подробные многоэтапные планы, которые координируются с людьми и другими роботами.
- Gemini Robotics On-Device 2 — облегченная версия модели VLA, оптимизированная для локального запуска на роботизированном оборудовании, что снижает зависимость от облачных подключений.
Согласно блогу DeepMind, каждая модель выполняет свою специализированную роль, но трио предназначено для работы как единая интегрированная система. Модель VLA обрабатывает действия в реальном времени, модель ER — планирование более высокого уровня, а вариант на устройстве обеспечивает ответы самого робота с малой задержкой.
От ступней до кончиков пальцев
Самым ярким заявлением в объявлении является то, что DeepMind называет интеллектуальным контролем всего тела. Вместо того, чтобы обучать робота повторению одного движения, Gemini Robotics 2 предназначена для управления всем телом гуманоида — от ступней до кончиков пальцев — обеспечивая полноценные движения, подобные человеческим, включая наклоны, вытягивание рук и балансирование.
DeepMind выделил несколько показателей ловкости. На демонстрациях было показано, как роботы, приводимые в движение этой моделью, вкручивают лампочки, завязывают узлы и выполняют другие деликатные действия, требующие точного управления моторикой. В лаборатории заявили, что система достигает нового уровня ловкости, который позволяет роботам выполнять задачи, требующие подлинной ловкости, а не грубого повторения.
Компания также подчеркнула адаптивность. По словам DeepMind, Gemini Robotics 2 можно адаптировать к любому двурукому роботу всего за несколько часов, а это означает, что тот же базовый интеллект может масштабироваться от настольной руки до сложного гуманоида без полного цикла переобучения. Это обобщение является существенным отходом от традиционной робототехники, где для каждой машины обычно требуется специально созданное программное обеспечение.
Роботы работают вместе
Еще одна важная возможность — совместная работа нескольких роботов. В DeepMind заявили, что Gemini Robotics 2 поддерживает сценарии, в которых два робота работают вместе над одной задачей, разделяя работу в общем физическом пространстве. Модель ER 2 обеспечивает координацию — анализ окружающей среды, планирование многоэтапной последовательности и распределение шагов между машинами.
В одной из демонстраций, на которую ссылается компания, пара роботов совместно убирала комнату, разделяя работу, а не сталкиваясь друг с другом. DeepMind назвал это первым доказательством того, что ИИ может управлять не только отдельными действиями, но и оркестровкой множества агентов в реальном мире.
Интерактивный и обучаемый
Помимо автономной работы, модели спроектированы так, чтобы быть интерактивными. Gemini Robotics 2 может объяснять свой подход во время выполнения действия, а пользователи могут перенаправлять робота в процессе выполнения задачи, используя повседневный язык, а не технические команды. В DeepMind заявили, что это делает платформу хорошо подходящей для обучения роботов в нестабильных или опасных средах, где операторам-людям приходится корректировать планы на лету.
Почему это важно
Запуск активизирует и без того многолюдную гонку гуманоидов-роботов. Такие компании, как Fig, Boston Dynamics и Tesla, стремятся коммерциализировать шагающие рабочие машины, а производители чипов, такие как Nvidia, вложили значительные средства в инфраструктуру моделирования и вычислений, необходимую физическому ИИ.
DeepMind делает ставку на то, что единый интеллектуальный уровень общего назначения, который рассуждает о физическом мире так же, как чат-бот рассуждает о тексте, может заменить специально разработанное узкое программное обеспечение, которое определяло промышленную робототехнику на протяжении десятилетий. Если система действительно сможет адаптироваться к любому варианту реализации за несколько часов, это снизит барьер для производителей и исследователей, желающих развернуть способных роботов, не начиная каждый раз с нуля.
Компания заявила, что работает с надежными партнерами по оборудованию над расширением платформы, и одновременно с выпуском опубликовала документацию по ответственности и безопасности. Остаются вопросы о том, как эти модели работают за пределами контролируемых демонстраций и как быстро управление всем телом гуманоида может перейти в надежное развертывание в реальных условиях.
Тем не менее, широта запуска — движение всего тела, многоэтапное мышление, эффективность на устройстве и многоагентная координация в одном семействе продуктов — сигнализирует о том, что Google намерена стать основным игроком в конвергенции больших моделей искусственного интеллекта и физических машин.
Будьте впереди ИИ
Граница робототехники движется быстро, и AI Buzz Wire отслеживает все важные разработки. Читайте больше новостей об искусственном интеллекте для постоянного освещения выпусков моделей, прорывов в области аппаратного обеспечения и изменений в отрасли.
Изучите последние разработки в области искусственного интеллекта →