スタートアップ TypeSafe AI の非 LLM の「意思決定モデル」である Jev は、ポケットモンスター 赤を完成させました。プロジェクトの Web サイトによると、総コンピューティングコスト約 1.65 ドルで、37 時間 40 分のプレイでパレットタウンから殿堂入りまで戦い抜きました。
開発者の Christian Mathiesen によって構築されたこの実行は、トークンとコストが表示された状態でライブ ストリーミングされ、GitHub でオープンソース化されました。この記事は週末に Hacker News のトップページに掲載され、数百の賛成票を集め、AI エージェントの将来についての内容について活発な議論が行われました。 Tom's Hardware はこの成果を取り上げ、従来のチャットボットが数か月間停滞していた場所で非 LLM エンジンが成功したこと、および Claude Opus 5 がモデルの行き詰まりを指導したことを指摘しました。
数字で勝負
プロジェクト独自の追跡からの統計は、この実行が AI システムとしていかに異常だったかを示しています。
- 合計時間: 37 時間 40 分
- 決定事項: 16,150
- 入力トークン: 約 3,920 万
- 合計 Jev コスト: 約 1.65 ドル
- 通常の決定時間: 0.4 秒
- 戦った敵: 約 1,660 人
- チームワイプ: 16
- エリート 4 回の試技: 15
- 最も厳しい区間: ビクトリーロード
最後の殿堂入りチーム: レベル 83 のリザードン。グラベル (62)、ニドクイン (45)、ビードリル (44)、ハウター (39)、およびプライムエイプ (29) がサポート。
経済が見出しです。コーヒー 1 杯以下の価格で 16,000 件の意思決定ができることは、長時間のセッションで数十ドルのトークンを消費する可能性がある LLM ベースのゲーム エージェントとは顕著な対照的です。マシーセン氏は、ジェブはすぐに決断できるが、ドゥームをプレイするにはまだ十分ではないと結論づけてポケモンを選んだと述べた。
なぜポケモン赤は AI にとって難しいのか
『ポケットモンスター 赤』は、エージェント AI のありそうもないベンチマークとなっています。 1996 年のゲームボーイのクラシックでは、レベルを磨き、6 人のパーティーを管理し、地図なしで迷路のような洞窟を移動し、重要なアイテムを見逃したときに後戻りするなど、長期的な計画が必要です。言語モデルのエージェントは歴史的に、堂々巡りをしたり、洞窟に閉じ込められたり、冗長なアクションで莫大な予算を費やしてきました。
Jev は根本的に異なるアプローチを採用しています。このモデルは、テキストを生成するのではなく、調整された決定を直接返します。この設計は、TypeSafe AI が、大規模なモデルの意図的で言語を多用した推論に代わる「System One」として販売しています。 Tom's Hardware のこのモデルに関する以前の記事によると、同社は、Jev は意思決定タスクにおいて LLM の代替手段よりもおよそ 193 倍高速で、445 倍安価であると主張しています。
開発者も認めたように、問題は、Jev が助けを必要としていたということです。 Tom's Hardware によると、Claude Opus 5 は、意思決定モデルを行き止まりまで指導しました。これは、大規模な言語モデルが戦略的なガイダンスを提供し、高速で安価なモデルが何千もの個別の意思決定を実行するハイブリッド アプローチです。プロジェクトのページには、Jev が「ガイドがあったから次にどこに行くべきかしか分からなかった」と皮肉っぽく書かれています。
AI エージェントにとっての意味
その結果、AI エージェントの将来は、すべてを行う 1 つの巨大なモデルではなく、分業化されるという議論が高まっています。つまり、高速で安価な専門モデルが高頻度の意思決定を処理し、状況があいまいになった場合にのみ、より遅い推論モデルが介入するというデータ ポイントが得られました。
ロボット工学、ゲーム、およびリアルタイム制御システム(ミリ秒単位で決定が下され、予算がセント単位で測定される領域)にとって、このアーキテクチャは魅力的です。倉庫ロボット、ゲームをプレイする NPC、または取引システムでは、すべてのマイクロアクションに対して 2 秒の GPT スタイルのラウンドトリップを行う余裕はありません。
Hacker News の懐疑論者は、このランの注意点を指摘した。ゲームは数十年前のもので徹底的に文書化されており、戦略的な重労働はコーチング モデルが行っており、エリート 4 の試行が 15 回あったということは、多くの試行錯誤があったことを示唆している。これらは正当な指摘ですが、より興味深いシグナルを見逃しています。 1 件あたり 0.0001 ドルでの 16,000 件の適切な意思決定は、まさに自律エージェントが大規模に実行する場合に必要なコスト プロファイルです。
元 OpenAI RLHF 研究者によって設立された TypeSafe AI は、Jev を言語モデルの代替ではなく補完として位置付けています。 Pokémon プロジェクト (コード、ストリーム、コストの内訳はすべて公開されています) は、意思決定優先のスタックで何ができるかをこれまでで最も鮮明に示しています。
完全なソース コードは GitHub で入手でき、ビクトリー ロードのすべてのワイプを含む完成した実行は YouTube で視聴できます。
AI の先を行く最新の AI 開発については、AI Buzz Wire をフォローしてください。
AIニュースをもっと読む→