OpenAI の GPT-6 Astra は、その記録に珍しいトロフィーを追加しました。それは、Valve の象徴的な一人称パズル ゲーム Portal のフル プレイスルーであり、総コンピューティング コスト 571.18 ドルで 24 時間以内に自律的に完了しました。 The Verge は 2026 年 9 月 6 日にこのマイルストーンを報告し、フロンティア モデルをゲームに接続し、残りの部分をゲームに理解させた cozyblaze というユーザーの功績を認めました。

Portal は、古いにもかかわらず、AI エージェントにとって厳しいテストです。 2007 年に Valve によってリリースされたこのゲームでは、プレイヤーはポータル ガンを使用して空間パズルを推理する必要があります。壁、床、天井にリンクされた開口部を作成し、直感に反してテスト チャンバーを通過するというものです。頼るべき戦闘の苦労や、従うべきクエストマーカーはありません。すべての部屋は本質的に物理学の謎です。フロンティア モデルのストレス テストがどのように行われているかを追っている読者にとって、この実行は、AI 開発の報道 の鮮明なエントリーです。

デモビデオから完全な完成まで

失点はどこからともなく生まれたわけではない。 9 月 6 日の初め、GPT-6 Astra が Portal をプレイしている様子を映した YouTube ビデオが Hacker News で拡散され、そのモデルがゲームを「自律的に完了」したと指摘するフォローアップの投稿が日が経つにつれて注目を集めました。 The Verge のレポートは詳細を裏付けています。試合全体は 24 時間以内に完敗し、計算コストは​​ 600 ドル未満でした。懐疑論者向けにその実行の要約ビデオが公開されました。

The Verge は法案の環境面を定量化せずにはいられず、このランニングでおそらくデータセンターの冷却に小さなプール約 1 杯分の水を消費したと指摘した。これは、エージェントによるゲームの実行はユーザーにとっては安価ですが、地球にとっては無料ではないということを痛烈に思い出させるものです。

2007 年のパズルゲームが重要なベンチマークである理由

Portal に勝つことは、ARC-AGI や SWE-bench のようなスケジュールされたベンチマークではありません。それが共感を集める理由の 1 つです。このゲームでは、歴史的に人間を AI システムから切り離してきたスキルがまさに要求されます。

  • 空間推論。 ソリューションには、ポータルの出口がプレイヤーの身体を発射する場所を予測する必要があります。これは、長年エージェントをつまずかせてきた 3 次元の物理推論です。
  • 長期的な計画。 チェンバースは複数のステップを連鎖させます。最後のステップに失敗すると、通常はシーケンスを最初からやり直すことになります。
  • 手を握ることなく失敗から学ぶ ヒントはありません。エージェントは試行錯誤を通じてゲームのルールを推測し、それを新しいチャンバーに一般化する必要があります。

今年初め、OpenAI の GPT-6 Astra が、エージェント推論に焦点を当てた ARC-AGI-3 ベンチマークでトップとなり、このモデルはコンピューター使用機能、つまり人間と同じようにソフトウェア インターフェイスを操作できる機能で注目を集めました。 Portal の実行は、人間の介入なしに何時間も展開される、同じスキルセット (認識、計画、制御) を遊び心たっぷりに、しかし本物にデモンストレーションするものです。

より広範な波の一部

この快進撃は、AI ゲームが 2026 年にどこに到達したかを示すものでもあります。ベンチマーク スコアは現在、文化的なマイルストーンとスペースを共有しています。モデルはバッハのコラールを作曲し、手書き修正認識テストを破り、かつては「コンピューターは決してこれをやらない」というフレーズの代わりとなったゲームを完成させました。パスを通過するたびに古い確信が薄れ、次のパスはどうなるのかという疑問が生じます。

実用的な意味もあります。 cozyblaze のセットアップで Portal を操作できる同じループ (数百ドルの費用で、スクリーンショットを入力し、決定を出力) が、ソフトウェア テスト、ロボット工学、およびコンピューター使用アシスタント向けに製品化されています。完全なプレイスルーに向けてゲームの物理学を念頭に置くことができるモデルとは、原理的には、コンテキストの短いシステムを打ち負かす長くて厄介なソフトウェア タスクを徹底的に処理できるモデルです。

ただし今のところ、要点はもっと簡単です。新しい GPU のデポジットとほぼ同じ価格で、AI がゲームで最も愛されているパズルの 1 つを最初から最後までクリアし、そのビデオを投稿しました。 Aperture Science の実験室は、人間が賢いと感じられるように設計されています。今週末、彼らはモデルを流暢に見せました。

ランがどのように受け取られたか

反応は一般に、最初に信じられず、次にビデオを見て、次に受け入れられるという AI ゲームのマイルストーンの弧を描きました。 Hacker News では、この実行について、セットアップがどのように機能するのか、そしてそれがエージェント AI について何を意味するのかを詳しく解説するコメント投稿者が絶え間なく集まりました。その中には、そのような実行にかかる費用の合計が、多くの人が想定していたよりも低かったと指摘する人もいた。完了の要約ビデオは、懐疑論者がその主張を自分で検証する方法を提供し、これはほとんどのベンチマーク結果が提供する以上のものです。

また、これまでのマイルストーンとの比較も求められました。ゲームは、ボード ゲームからリアルタイム ストラテジー、オープンエンドのサンドボックスに至るまで、何十年にもわたってこの分野の公共実験場として機能してきました。試合が敗れるたびに、議論は変わる。今日の懐疑論者は、その偉業は限定的で特殊なものであった、あるいは一般化できない何らかの点で特殊なものだったと主張する。その歴史の中でポータルの運営が注目に値するのは、そのセットアップがいかに平凡だったかということです。つまり、ゲーム用に特別に訓練されたオーダーメイドの研究システムではなく、市販のフロンティア モデル、コンシューマー ゲーム、そして数百ドルのコンピューティングでした。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→