AI のパイオニア、フェイフェイ・リーによって設立された空間インテリジェンス企業 World Labs は、2026 年 9 月 1 日に Atlas を導入し、それを次世代の「オムニ」世界モデルと説明しました。チームは同社のブログ投稿で、Atlas はテキスト、画像、ビデオ、3D をネイティブに操作できるようにゼロから事前トレーニングされていると述べた。これらのタスクのいずれかに特化するのではなく、世界を生成、再構築、シミュレーションするために構築された単一のモデルである。

この発表は、リー氏が創業以来支持してきた世界モデルの理論、つまりAIの次のフロンティアは言語だけでなく、世界がどのように現れ、動作し、進化するかを理解するシステムにあるという理論のマイルストーンとなる。 World Labs は、クリエイティブなユーザー向けに想像上の世界をレンダリングし、現実世界を忠実にシミュレートし、ロボットの行動計画を支援するための基盤としてこのテクノロジーを構築しています。この取り組みやその他の最先端の研究活動の詳細については、AI 業界の報道をご覧ください。

1 つのモデル、共有された空間コンテキスト

アーキテクチャ的には、Atlas は World Labs がマルチモーダル自己回帰拡散トランスフォーマーと呼ぶものです。大規模な言語モデルと同様に、最初に入力をコンテキストにエンコードし、次にそのコンテキストに応じた出力を生成します。違いは空間的なものです。各入力画像は空間内の 3D 位置に固定され、同社が空間コンテキストと呼ぶものを形成します。Atlas は、見たものすべてと 3D の一貫性を保ちながら、その先にあるものを想像しながら、次に来るものを生成します。

この設計により、従来のビデオ ジェネレーターに取り付けるのが難しい機能が可能になります。 2 つの無関係な参照画像を異なる 3D 位置でコンテキストに配置することができ、Atlas はそれらの間をスムーズに補間する世界を生成し、2 つのシーンをもっともらしく橋渡しする出入り口、廊下、トランジションを発明します。同社はまた、このモデルはスケールに合わせて構築されており、トレーニングの計算量が増加するにつれてパフォーマンスが向上すると述べた。

ピクセル完璧なカメラ制御と長時間ビデオ

Atlas のマーキー生成機能はカメラ制御ビデオです。このモデルは、1 ~ 6 つの入力画像から、正確に指定されたカメラ パスに従い、解像度 1440p で最大 1 分間のビデオを生成できます。 World Labs は、カメラ ジオメトリが粗いテキスト プロンプトを超えたネイティブ入力タイプであるため、クリエイターがすべてのショットをフレームに収め、すべてのモーションを制御できることを強調しています。デモでは、チームが手作業でカメラの経路をシーン内を移動し、一貫した 1 分間のクリップを作成します。その体験は、スロット マシンのレバーを引くのではなく、「ディレクターの椅子に座っている」ようなものだと説明されています。

このモデルは、複雑なプロンプトに従い、テキストをレンダリングし、さまざまな視覚スタイルを生成する機能を備えて、テキストから画像と 360 度のパノラマも生成します。

スペシャリストモデルに挑戦する再構築

再構築の面では、World Labs は大胆な主張を行っています。Atlas は、わずか 2 ~ 3 枚の通常の画像から現実世界のシーンを再構築し、「3D 再構築専用に特別に訓練されたモデルによる最先端の結果を上回るパフォーマンスを発揮します」。同社は、まばらな入力からの新しいビューの合成を、3D コンピュータ ビジョンにおける数十年来の基本的な問題と呼んでいます。

Atlas は、実際の環境を忠実に再現するために 100 を超える入力画像を取り込むこともできます。あるデモンストレーションでは、チームは 2 ~ 25 枚の地上写真からスタンフォード大学のメイン クワッドを少しずつ再構築し、キャンパスの上空を飛ぶ空中経路を生成し、これまでカメラが捉えなかった景色を埋め尽くしました。

実際の使用において重要なのは、Atlas は 2D フレームにとどまりません。画像フレームと 3D 深度マップをネイティブに操作し、高解像度とフレーム レートでデバイス上でレンダリングする点群または 3D ガウス スプラットとして世界を出力します。これは World Labs の最初の製品である Marble で使用されているのと同じ表現であるため、Atlas の出力は会社の既存のパイプラインに直接接続されます。

バレットタイムからロボットトレーニングまで

Atlas のシミュレーション機能は、ロボット工学にとって最も重要かもしれません。同社は、Atlas がシーンを再構築し、特殊なキャプチャ スタジオを必要とせず、不可能な角度からの「バレットタイム」リフレーミングを可能にするためには、バックパックに収まる三脚とクランプで取り付けられたわずか 3 台の通常の携帯電話カメラからの映像で十分であることを示しました。

Real-to-Sim ワークフローの場合、Atlas は短い電話ビデオから空間を再構築し、シミュレートされたロボットの身体に取り付けられたカメラがパスに沿って観察する RGB データと深度データを生成します。世界とロボットの視点は同じモデルからのものです。同社は、それぞれ 24 フレームを使用して大規模なスキャン環境にわたるナビゲーションと、タスクのシミュレーション後にオブジェクト、位置、シーンを変更することでシミュレートされたタスクを変更できる操作シナリオをデモンストレーションしました。

なぜそれが重要なのか

ワールド モデルは、大規模な言語モデルを補完するものとしてますます見なされています。LLM は世界の記述について推論しますが、ワールド モデルは世界そのもの、つまりその幾何学、物理学、時間の経過に伴う力学をモデル化することを目的としています。 Atlas の主張が外部の監視下で有効であれば、アプリケーションは VFX、ゲーム、デザイン、エンジニアリング、ロボット トレーニングに及び、合成的だが物理的に妥当な環境によって、機械に動作を教えるコストが大幅に削減される可能性があります。

このモデルを開発した企業は、それ自体が注目に値します。 World Labs は、ジャスティン ジョンソン、ベン ミルデンホール、クリストフ ラスナーとともに、ImageNet の作成で深層学習時代の火付け役となったスタンフォード大学教授フェイフェイ リーによって設立されました。その投資家リストには、a16z、Nvidia、AMD、Intel、Adobe、Salesforce、Samsung などが含まれています。同社の最初の製品である Marble を使用すると、ユーザーは画像、ビデオ、テキスト、3D レイアウトから永続的な 3D 世界を作成でき、World Labs は、Atlas がその将来のバージョンに搭載されると述べました。

Atlas はまだ一般提供されていません。同社は早期アクセスのリクエストを受け付けています。それでも、このリリースは、単に物理世界を記述するだけでなく、その一貫した操作可能なモデルを保持する AI システムに向けた、これまでで最も具体的な一歩の 1 つを示しています。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→