フランスの AI 企業 Mistral AI は、1 台の通常の RGB カメラだけを使用してロボットが複雑な環境を自律的に移動できるようにする 80 億パラメータ モデルである Robostral Navigate でロボット工学分野に参入しました。 2026 年 7 月 8 日に発表されたこのモデルは、ミストラルの具体化された AI および物理ロボット工学への最初の動きを表しています。
Robostral Navigate は、RGB 画像と平易な言語の指示を受け取り、オフィス、住宅の建物、屋外スペースなどの環境内でロボットを移動させます。他のモデルと異なるのは、そのハードウェアのミニマリズムです。通常、競合モデルは深度センサー、LiDAR、または連携して動作する複数のカメラに依存していますが、Robostral Navigate は 1 台の標準 RGB カメラのみを使用し、深度センサーを一切使用しません。新しい AI モデルの発売に関する包括的な報道については、読者は当社のホームページで最新の AI 開発をフォローできます。
R2R-CE の最先端のパフォーマンス
Robostral Navigate は、単一カメラのアプローチにも関わらず、トレーニング中に実施される環境でのナビゲーション指示に従うための標準テストである R2R-CE (連続環境におけるルームツールーム) 検証の目に見えないベンチマークで 76.6% の成功率を達成しています。この結果は、単一カメラによるこれまでの最高のアプローチを 9.7 ポイント上回り、深度センサーまたは複数のカメラを使用した最高のシステムを、どちらも使用していないにもかかわらず 4.5 ポイント上回っています。
検証の結果、モデルの成功率は 79.4% に達しました。ミストラル氏によると、このモデルはロボットの種類を超えて一般化され、車輪付きロボット、脚付きロボット、さらには飛行ロボット上で動作し、再トレーニングすることなくロボットのサイズに適応します。
完全にシミュレーションで構築
Robostral Navigate の最も注目すべき側面の 1 つは、完全に社内で構築され、シミュレーションのみでトレーニングされたことです。ミストラルは、6,000 のシミュレートされたシーンにわたって収集された約 400,000 の軌跡のデータセットを生成する効率的なデータ生成パイプラインを構築しました。このシミュレーションファーストのアプローチにより、実世界のデータ収集に伴うコストやロジスティック上の課題を発生させることなく、迅速な反復が可能になりました。
このモデルは、ポインティング、カウント、オブジェクトの位置特定などのグラウンディング タスクに特化した、ミストラル独自の視覚言語モデルから初期化されています。ナビゲーションは、これらの機能の自然な拡張として生まれます。モデルは、画像内で物がどこにあるかを理解すると、そこに向かって移動する方法を学習します。特に、Robostral Navigate は既存のオープンソースのビジョン言語モデルに依存しません。
ポインティングベースのナビゲーションと強化学習
Robostral Navigate は、ポインティング ベースのナビゲーション メカニズムを使用します。タスクと観察履歴が与えられると、モデルは、ロボットの現在のカメラ ビュー内のターゲット位置の画像座標と、到着時の望ましい方向を推測することで、ロボットが次に移動すべき場所を予測します。このポインティング アプローチにより、メトリック ディスプレイスメントに依存するコマンドとは異なり、ポリシーがカメラの固有機能やワールド スケールの変更に対して自然に堅牢になります。
ターゲットの位置が現在の視野の外側にあり、ポインティングが適用されない場合、モデルはロボットのローカル座標フレーム内の変位に戻ります。教師ありトレーニング後、ミストラルは CISPO アルゴリズムを使用したオンライン強化学習を適用しました。これにより、モデルは試行錯誤から学習し、失敗から回復し、探索的行動を獲得できるようになりました。この強化学習段階だけで成功率が 3.2 パーセント向上し、パフォーマンスは頭打ちの兆候もなく依然として上昇していると Mistral は報告しています。
プレフィックス キャッシュによる効率的なトレーニング
重要な技術革新は、プレフィックス キャッシュに基づく効率的なトレーニング アルゴリズムです。ミストラルの手法では、ツリーベースのアテンション マスキング戦略を使用してエピソード全体を 1 つのシーケンスに圧縮し、タイム ステップ間の情報漏洩を防ぎながら、単一のフォワード パスですべてのタイム ステップのトレーニングを可能にします。タイム ステップごとに 1 つのサンプルを使用するトレーニングと比較して、このアプローチでは、すべての学習信号を維持しながらトレーニング トークンの数が 22 分の 1 に削減されます。同社によれば、実際には、これにより数か月かかるトレーニングの実行が数日で完了するようになるという。
アプリケーションと今後の展開
ミストラルは、Robostral Navigate を、今日の顧客にとって最も需要の高い機能の 1 つに対応できるものと位置づけています。このテクノロジーにより、製造、配送、物流、ホスピタリティにわたるアプリケーションが可能になります。モデルに 1 つの指示を与えると、モデルは自律的にタスク全体を完了し、トレーニング中には表示されなかった人や障害物でいっぱいの現実の空間を移動します。
同社は、このリリースは統合された身体型エージェントに向けた最初のステップにすぎないと説明しています。ミストラルはロボット工学チームを積極的に拡大しており、研究科学者とエンジニアを探しています。この立ち上げは、主に大規模な言語モデルで知られてきたパリに本拠を置くスタートアップにとって、重要な戦略的拡大を示すものであり、現在は物理的な AI とロボット工学への真剣な取り組みを示しています。
ロボット工学への動きは、広範な AI 業界が身体化型 AI への投資を増やしており、企業は言語モデルの機能を物理世界のインタラクションにどのように拡張できるかを模索している中で起こります。ミストラルのシミュレーションファーストのシングルカメラアプローチは、特にマルチセンサーセットアップが現実的でないコスト重視の商用アプリケーションにおいて、自律ナビゲーションシステムの導入に対する障壁を下げる可能性があります。
AI の先を行く
Robostral Navigate は、Mistral の顧客が利用できるようになりました。 AI の最新ニュースと分析について詳しくは、AI Buzz Wire をご覧ください。
AIニュースをもっと読む→


