OpenAI の GPT-6 Astra は、コーディングの面でユーザーの信頼性の問題に苦戦しているかもしれませんが、新しいロボット工学ベンチマークでは、研究者が質的飛躍について語る数字を発表しています。普通のデスクオブジェクトを中心に構築されたテストである StationeryBench では、Astra は 100 タスク中 7 タスクを完全に完了しましたが、対戦相手のモデルである Ai2 の MolmoAct2 はゼロで完了しました。
The Decoder が説明したこのベンチマークでは、マーカーのキャップを開ける、クリップを注ぎ出す、2 つのロボット アームの間で定規を通過させるなど、5 つのデスク オブジェクト タスクにわたって 2 つのモデルを相互に比較します。どちらのモデルも、200 回のトライアルにわたって同じ双腕 YAM ロボットを制御しました。これは、ハードウェアの違いからモデルの機能を分離することを目的とした制御設計です。すべての結果、ビデオ、コードは GitHub で公開されています。このような研究報道の詳細については、AI ニュース ハブ をチェックしてください。
研究者らによると「段階的変化」
Cornell と Google DeepMind の AI 研究者である Yoav Artzi 氏は、Astra のパフォーマンスを「空間推論における段階的な変化」と呼び、言語ベンチマークの結果が得られることはほとんどありません。 REMAPと呼ばれる未公開のベンチマークでは、Astraは人間のレベルに近い精度に達しているが、Artzi氏は「Astraでさえ、他のシナリオで人間が行うことには及ばない」と述べた。
Astra の進捗スコアの中央値は 100 点中 46 点でしたが、MolmoAct2 は 12 点でした。この差は、見出しの完了数が示唆するよりも重要です。ロボット工学のタスクは完全な成功だけでなく部分的な進捗にも基づいて評価され、ライバルの中央値スコアが 3 倍であるということは、モデルが数回の試行で運よく成功したのではなく、操作シーケンスを通じて一貫して進歩していることを示しています。
空間推論が突然重要になる理由
この結果は、アストラがどのように訓練されたかを示唆しています。 Artzi 氏は、OpenAI が、Blender シーンなどの大量の 3D データでモデルをトレーニングしたのではないかと疑っています。これは、3D タスクにおけるモデルの特別な強みと一致するものであると考えられます。この見方が正しければ、現実世界のデータ収集よりも安価で安全な合成 3D 環境が、ロボット工学における長年のボトルネックの 1 つである物理世界の能力への実行可能な道になりつつあることを示唆しています。
ベンチマークの設計は、ロボット評価の方向性についても何かを語っています。 StationeryBench のタスクは、マーカーのキャップを外したり、ペーパークリップを注ぎ出したり、定規を渡したりするなど、意図的に日常的なものになっています。なぜなら、映画のような偉業ではなく日常的な操作が、実験室でのデモと便利なマシンを区別するものだからです。 200 回のトライアルにわたって同じデュアルアーム YAM ハードウェアで両方のモデルを評価し、すべてのビデオを公開することは、フロンティア ラボの主力製品に関わる機能主張としては異例の透明性のある設定です。
Allen Institute for AI (Ai2) の比較モデルである MolmoAct2 は、どのタスクも完了していないこと自体が一種のデータです。これは、少なくとも推論を重視した操作に関しては、汎用フロンティア モデルと専用のロボット工学モデルの間のギャップが単に縮まるだけでなく逆転しつつあることを示唆しています。
The Decoder が引用した報道によれば、これは OpenAI が表明した野心とも合致します。つまり、同社は独自の消費者向けロボットを構築する長期計画を持っているとのことです。物体、手、軌道について推論できる最先端の言語モデルは、そのピッチの半分のソフトウェアです。ハードウェアの半分は未解決のままですが、StationeryBench のようなベンチマークは、そのストーリーを評価する方法です。
コンテキスト: 複雑な週を伴うモデル
その結果、OpenAI にとって奇妙なニュースサイクルが発生します。このベンチマークの中心となっている同じモデルは、発売以来愚かになったというユーザーからの苦情に 1 週間直面しました。苦情 OpenAI は、Codex の使用制限をリセットする前に、スキルの誤爆からコンテキストの不正な動作まで、3 つの名前付き欠陥を追跡しました。実験室で段階的な変化の結果を報告しながら、実稼働環境でつまずくモデルは、現在の AI 業界の現実です。機能と信頼性は異なるクロックで進歩しています。
また、OpenAI 自身のリーダーシップも参加した安全性に関する議論の真っ只中にも上陸しました。同社の主任科学者は、自律性が高まるシステムの制御を解決できる研究室は存在しないと警告し、Anthropic の CEO は業界に対し、フロンティア開発を完全に遅らせるよう求めた。物理世界を操作するモデルを示すベンチマークは、たとえ世界が文房具で覆われた机にすぎないとしても、まさに両経営陣が進歩のペースが監視を上回っていると主張する際に引用するような結果だ。
結論
100 件のタスクのうち 7 件が完全に完了したとしても、明日ロボットを机に置くことはできません。しかし、ライバルの0点から7点になり、進歩スコアの中央値が3倍になったことは、2年前に言語理解能力のグラフを書き換えたような不連続性だ。未解決の問題は、開発者が喜んで支払う価格で、同じモデルがその能力をベンチマーク外で確実に提供できるかどうかです。
AI の先を行く
ベンチマーク、画期的な進歩、そして機能するマシンへの競争が毎日続いています。
AIニュースをもっと読む→