分散型 AI ラボ Prime Intellect は、今日のフロンティア AI モデルが自律的な機械学習研究をどの程度うまく実行できるかをテストした大規模実験の結果を発表しました。その結果、最も優れたものは、有名なコミュニティ ベンチマークで人類の世界記録に驚くほど近づきました。
NanoGPT Speedrun Frontier と名付けられ、8 月 22 日に公開されたこのプロジェクトは、nanoGPT オプティマイザー Speedrun を試行する 18 のフロンティア モデルにわたる 153 の自律実行で構成されています。これは、研究者が小さな言語モデルを一定の品質目標に合わせてトレーニングする最も効率的な方法を探すコンテストです。この記事はすぐに Hacker News のトップページに掲載され、真の科学的発見に対する AI の能力について結果が何を物語るかを議論する数十のコメントが集まりました。 この件の詳細は、人工知能の最新情報をご覧ください。
NanoGPT Speedrun の実際とは
このベンチマークは、Keller Jordan とコミュニティ貢献者の長いリストによって維持されている modded-nanogpt リポジトリから取得されています。課題は一見単純に述べられています。8 つの NVIDIA H100 GPU を使用して、FineWeb 検証セットで 3.28 クロスエントロピー損失 (Andrej Karpathy のオリジナル GPT-2 レプリケーションが 45 分後に到達したパフォーマンス レベル) に到達する言語モデルを可能な限り高速にトレーニングします。
過去 2 年間にわたる何百ものコミュニティの貢献により、人類の記録は 75 秒未満、トレーニング トークン 4 億未満まで短縮され、元のレシピの 30 倍以上の改善となりました。受賞したソリューションは、現代の ML エンジニアリングのカタログのようなものでした。Muon オプティマイザー、QK-Norm によるロータリー エンベディング、ReLU 二乗アクティベーション、アテンションと MLP パスの FP8 量子化、スライディング ウィンドウ パターンを備えた Flash アテンション 3、その他数十の技術が積み重ねられています。
Prime Intellect のテストではベンチマークのオプティマイザー トラックを使用しました。これにより、リポジトリのドキュメントによると、固定アーキテクチャ、データセット、バッチ サイズに応じて、事実上無制限の実時間予算で目標損失に達するために必要なトレーニング ステップの数が最小限に抑えられます。そのため、生のハードウェア速度ではなく、アルゴリズム発見の純粋なテストになります。
実験の仕組み
18 の各モデルには、トレーニング レシピの変更を提案し、実験を実行し、結果を検査し、反復するというタスクが自律的に与えられました。固定された検証スクリプトと固定されたランダム シードを使用して、主張された改善が幸運な実行ではなく実際であることを確認します。 Hacker News のコメント投稿者の 1 人が要約したように、モデルは小規模モデルのトレーニングを改善する方法を研究するよう求められ、変更を繰り返し試し、テストし、その結果を使用して次に何を試行するかを決定しました。
モデルは、claude-code、OpenAI の codex、kimi-code、grok-cli、qwen-code、Prime Intellect 独自のプライム エージェントを含むさまざまなエージェント ハーネスを通じて機能し、チームはすべての実行のトークン消費、実験回数、ツール呼び出し、エージェントの経過時間を追跡しました。合計すると、実験ではトップモデルごとに数億のトークンが消費され、グリッド全体では数十億のトークンが消費されました。
リーダーボード: Fable 5 がパックをリード
見出しの結果: クロード コード ハーネスを介して実行された Fable 5 として特定されたモデルは、ベースライン レシピと人間の記録の間のギャップの 81.7% を埋め、リーダーボードのメトリクスで検証された最高の結果 2,726 を記録しました。そこに到達するまでに、エージェントの累積時間は 8.7 日、約 8 億トークン、811 回の実験、および約 3,000 回のツール呼び出しを要しました。
追いかける集団は、53.6% の差を縮めた Opus 5 がリードし、Prime Intellect のプライム エージェント ハーネスによって駆動された 52.2% (および kimi-code 経由で 45.8%) で Kimi K3 が僅差で続きました。 Opus 4.8 は 39.4 パーセントを管理し、いくつかの GPT-5.6 バリアントはおよそ 11 ~ 36 パーセントの間で着地し、Sonnet 5 は 26.8 パーセントで終了し、Grok 4.5 と Qwen3.8 Max はそれぞれ約 24.6 パーセントに達しました。
さらに下位では、DeepSeek V4 Pro がその差を 12.3 パーセントに縮め、GPT-5.5 は 8.1 パーセントに達し、古い Kimi K2.7 は 7.2 パーセントで終了しました。特に、最近リリースされたモデルの 1 つである GLM 5.3 は、公開時点ではまだ動作しており、検証された記録はありませんでした。これは、ベンチマークが自身の改善を確実に検証できないモデルを罰することを思い出させます。
なぜそれが重要なのか
このようなベンチマークが重要なのは、コーディング リーダーボードでは測定できないもの、つまり仮説、実験、分析、修正という本物の研究ループを数分ではなく数日かけて実行できる能力を測定するためです。この機能は、自律型 AI 研究という新興分野の基礎であり、エージェントは仕様に合わせてコードを書くのではなく、誰も見せていないものを発見するという任務を負っています。
結果の広がり自体が有益です。プロジェクトの報告書によると、実験のほぼすべてのモデルで同じ核となる勝利アイデアが見つかりました。最良の実行を分けたのは、実験が何を残したかでした。より強力なエージェントは、ノイズの多い結果の弱い信号を検証するのに十分な期間保存し、自身の実験データをよりよく理解しました。
コミュニティからの警告
Hacker News のコメンテーターは、方法論上の公正な点を指摘しました。努力の設定とハーネスはモデルによって異なり、Fable 5 は高い推論設定で実行され、Opus 5 は最大で実行されました。18 のモデルで 153 回の実行という算術演算は、一部のモデルが他のモデルよりも多くの試行を受けたことを意味します。モデルのランキングがその生の研究能力を反映しているのか、それともハーネスの品質を反映しているのかは未解決の問題のままです。
それでも進行方向は明確です。人間の手による最速の記録が現在の記録に到達するまでに何年もの共同作業が必要でしたが、現在では最高の自律エージェントが 1 週間強の計算時間でそのギャップのほとんどを埋めています。次の疑問、つまり残りの 18.3 パーセントを達成できるモデルがあるかどうかという問題は、予想よりも早く答えられるかもしれません。
AI のフロンティアを形成するベンチマークと研究の詳細については、AI Buzz Wire の継続的な報道に従ってください。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →