Google DeepMind は、物理 AI モデルのファミリーである Gemini Robotics 2 を発表しました。これは双腕ワークステーションから完全な人型の体に至るまで、あらゆる種類のロボットをインテリジェントに制御できると研究室は述べています。これは、動く機械の世界への同社のこれまでで最も野心的な取り組みを示しています。

2026 年 7 月 30 日に発表されたこのリリースは、ロボットが見聞きしたものを正確な運動コマンドに変換するビジョン言語アクション (VLA) モデルを中心としています。 DeepMind はこれを汎用ロボット工学のインテリジェンス層と説明しており、同社はこの発表をチャット ウィンドウから物理世界に AI を導入する転換点と位置づけています。業界全体での身体化型 AI への取り組みの詳細については、AI ニュース速報 をご覧ください。

3 つのモデル、1 つのシステム

DeepMind は、Gemini Robotics 2 ラインナップで 3 つの補完モデルを出荷しました。

  • Gemini Robotics 2 — 視覚と言語をモーター制御に変換し、ロボットが物理的な動作を実行できるようにする主力 VLA モデル。
  • Gemini Robotics ER 2 — 物理空間を理解し、人間や他のロボットと連携する詳細な複数ステップの計画を作成できる身体的推論モデル。
  • Gemini Robotics On-Device 2 — ロボット ハードウェア上でローカルに実行するように最適化された VLA モデルの軽量バージョンで、クラウド接続への依存を軽減します。

DeepMind ブログによると、各モデルには専門的な役割がありますが、この 3 つのモデルは単一の統合システムとして動作するように設計されています。 VLA モデルはリアルタイム アクションを処理し、ER モデルはより高レベルの計画を処理し、オンデバイス バリアントはロボット自体での低遅延応答を可能にします。

足先から指先まで

発表の中で最も印象的な主張は、DeepMindがインテリジェントな全身制御と呼ぶものである。 Gemini Robotics 2 は、ロボットに 1 つの動作を繰り返すよう訓練するのではなく、足から指先まで人型の体全体に命令するように設計されており、曲げる、手を伸ばす、バランスを取るなど、人間のような全範囲の動作を可能にします。

DeepMind は、いくつかの器用さのベンチマークを強調しました。デモンストレーションでは、このモデルを搭載したロボットが、電球をねじ込んだり、結び目を結んだり、細かいモーター制御を必要とするその他の繊細な動作を実行する様子が示されました。同研究所によると、このシステムは新たなレベルの器用さを実現し、ロボットが乱暴な繰り返しではなく真の繊細さを要求されるタスクを完了できるようになったという。

同社は適応性も重視した。 DeepMind 氏によると、Gemini Robotics 2 はわずか数時間であらゆる双腕ロボットに適応できるということは、完全な再トレーニング サイクルを必要とせずに、同じ基盤となる知能を卓上アームから複雑なヒューマノイドまで拡張できることを意味します。この一般化は、各マシンが専用のソフトウェアを必要とする従来のロボット工学とは大きく異なります。

ロボットが連携して働く

もう 1 つの主要な機能は、マルチロボットのコラボレーションです。 DeepMind によると、Gemini Robotics 2 は、共有の物理空間で分業し、2 台のロボットが単一のタスクに協力して作業するシナリオをサポートしています。 ER 2 モデルは、環境に関する推論、マルチステップ シーケンスの計画、マシン間でのステップの割り当てといった調整を処理します。

同社が引用したあるデモンストレーションでは、一対のロボットが協力して部屋を掃除し、互いにぶつかるのではなく作業を分担した。 DeepMind はこれを、AI が個々のアクションだけでなく、現実世界の複数のエージェントのオーケストレーションも管理できることを示す初期の証拠として位置づけました。

インタラクティブで指導可能

自律的な操作を超えて、モデルはインタラクティブになるように設計されています。 Gemini Robotics 2 は、アクションを実行しながらそのアプローチを説明でき、ユーザーは技術的なコマンドではなく日常の言語を使用してタスク中にロボットをリダイレクトできます。 DeepMindは、このプラットフォームは、人間のオペレーターがその場で計画を調整する必要がある、不安定または危険な環境でロボットを指示するのに適していると述べた。

なぜそれが重要なのか

この打ち上げにより、すでに混雑しているヒューマノイドとロボットの競争が激化します。 Figure、Boston Dynamics、Tesla などの企業は、歩行型作業機械の商品化を競い合っている一方、Nvidia などのチップメーカーは、物理 AI に必要なシミュレーションとコンピューティング インフラストラクチャに多額の投資を行っています。

DeepMind の賭けは、単一の汎用インテリジェンス層 (チャットボットがテキストについて推論するのと同じように、物理世界について推論する層) が、数十年にわたって産業用ロボットを定義してきた特注の限定されたソフトウェアを置き換えることができるというものです。実際にシステムがあらゆる実施形態に数時間で適応できるのであれば、毎回最初から始めることなく、有能なロボットの導入を検討している製造業者や研究者にとっての障壁が低くなるでしょう。

同社は、信頼できるハードウェアパートナーと協力してプラットフォームを拡張しており、リリースと同時に責任と安全に関する文書を公開したと述べた。これらのモデルが制御されたデモンストレーション以外でどのように動作するか、また全身の人型制御がどの程度迅速に信頼性の高い現実世界への展開に変換できるかについては疑問が残ります。

それでも、全身の動き、複数のステップによる推論、デバイス上の効率性、および単一の製品ファミリーでのマルチエージェントの調整など、今回のリリースの範囲の広さは、Google が大規模な AI モデルと物理マシンの統合において主要なプレーヤーになるつもりであることを示しています。

AI の一歩先を行く

ロボット工学のフロンティアは急速に進歩しており、AI Buzz Wire はあらゆる主要な開発を追跡しています。 AI ニュースの続きを読む では、モデルのリリース、ハードウェアの画期的な進歩、業界の変化を継続的に取り上げています。

最新の AI 開発を詳しく見る →