新しいベンチマークは、AI 業界が科学的能力を測定する方法に挑戦しており、その最初の結果はフロンティアの研究機関にとって屈辱的なものです。 Terminal-Bench-Science 0.1 は、スタンフォード大学の研究者と人気の Terminal-Bench コーディング ベンチマークの背後にあるチームによって今週開始され、現役の科学者が貢献した実際の科学研究ワークフローに基づいて AI エージェントを評価します。テストされた最も強力なモデルである Claude Code を実行する Claude Opus 5 は、タスクのわずか 30% を完了しました。

ベンチマークの発表ページには、その指針となる原則が率直に説明されている。モデル開発者やデータベンダーではなく、科学者がAIにおける科学的能力の基準を設定すべきである。このプロジェクトは世界中の研究機関の専門家と協力して構築され、最初のリリースには生命科学、物理学、地球科学、数学、工学にわたる 70 のタスクが含まれています。

教科書のベンチマークとの違い

ほとんどの科学的な AI 評価では、多肢選択問題、教科書の問題、標準化された演習などの知識がテストされます。代わりに、ターミナル ベンチ サイエンスでは、エージェントが、実際の研究者の 1 日を埋める、技術的に要求が高く時間のかかるワークフロー (どの試験にも出てこない種類の作業) を実行できるかどうかを測定します。タスクは現実的な環境で実行され、評価は分析、シミュレーション、証明、コード、データ製品などの具体的な成果物に基づいて行われ、モデルや多肢選択式の採点ではなく、再現可能なタスク固有のテストでチェックされます。

この設計は、AI アシスタントが最終的に科学のために何をすべきかという理論を反映しています。ベンチマークの作成者らは、科学的判断を置き換えるのではなく、エージェントが実行層(コンピュータ内での実験の実行、データの処理、証明のチェック)を引き継ぎ、科学者を研究の中で人間の判断が最も重要な部分(質問の定義、仮説の形成、結果の解釈、結果の伝達)に専念できるようにすべきだと主張している。

このプロジェクトは、移動ターゲットとしても明示的にビルドされます。多くのベンチマークは一度リリースされて放棄されますが (発表ではこれを「論文の出版」問題と呼んでいます)、ターミナル ベンチ サイエンスはフロンティアに沿って進化する継続的なベンチマークとして設計されており、定期的なリリースはモデルの進行に先立って評価を維持し、汚染によるスコアのインフレを防ぐことを目的としています。

最初のリーダーボード: 信頼できるものには程遠い

今週 Hacker News に掲載されたときに大きな注目を集めた v0.1 リーダーボードは、トップからの急激な下落を示しています。

  • クロード作品5(クロード・コード):30.0%
  • GPT-5.6 ソル (コーデックス): 22.4%
・クロード寓話5(クロードコード):21.4%
  • クロード オーパス 4.8 (クロード コード): 10.5%
  • GPT-5.6 Terra (コーデックス): 8.6%
  • GLM 5.3 (クロードコード): 8.1%
・キミK3(クロード・コード):7.1%
  • Grok 4.6 (Grok ビルド): 7.1%
  • GPT-5.6 ルナ (コーデックス): 3.3%

この結果は、元のターミナルベンチや競合するコーディング ベンチマークのスコアが急速に上昇しているソフトウェア エンジニアリングよりも、科学的なワークフローが依然としてエージェントにとって大幅に難しいことを示唆しています。利用可能な最良のシステムの解決率が 30% ということは、実際の調査タスク 10 件中 7 件では、強力なハーネスと組み合わせたトップ層エージェントでさえ、検証可能な正しい作業を生成できないことを意味します。

モデルファミリー内の広がりも有益です。 Claude Opus 5 と Claude Opus 4.8 の間のギャップ (約 20 ポイント)、および GPT-5.6 バリアント Sol、Terra、Luna の間のギャップは、結果の品質が生のモデル インテリジェンスだけではなく、モデルとエージェント ハーネスの相互作用にどれだけ依存しているかを示しています。高得点のエントリーはすべてエージェント コーディング ハーネス (Claude Code、Codex、Grok Build) を使用しており、基礎となるウェイトと同じくらい足場が決定的であるという新たなコンセンサスを強化しています。

科学者が独自のベンチマークを構築した理由

ベンチマークの枠組みには制度上の微妙な議論がある。発表では、「科学における賭け金は高すぎる」と述べ、「そのベンチマークは外部の利益ではなく、科学界の優先事項を反映する必要がある」としている。このプロジェクトは、現役の研究者に、実際に自動化が必要なタスクをエンコードするための直接的なメカニズムを提供し、「科学的発見の加速」というベンダーの主張を検証可能な基準に照らして保持できるようにします。

マーケティングと現実とのギャップが現実の結果をもたらすため、これは重要です。フロンティアラボが、エージェントが独立している一方で研究を加速できると主張する場合、専門家が設計した評価では、解決率が1桁から30%であることが示されており、資金調達の決定、雇用計画、およびそれらの主張に基づいて構築されたラボのポリシーは誤りを引き継いでいます。コミュニティが所有する継続的なベンチマークは修正の 1 つであり、曖昧な主張を再現可能な数値に変換します。

研究機関へのシグナル

エージェントをいつ導入するかを検討している大学、国立研究所、研究開発チームにとって、このベンチマークは、ベンダーのデモでは提供できないもの、つまりコミュニティが管理する信頼性ラインが実際にどの位置にあるかを測定するものを提供します。解決率が 10 代または 20 代であるということは、これらのシステムが現在、実験パイプラインの自律的な実行者としてではなく、レビューが必要なアシスタントとして最もよく扱われていることを意味します。生命科学、物理学、地球科学、数学科学、工学科学に及ぶタスク カテゴリは、一般的なベンチマークでは日常的に見落とされがちな分野からのワークフローに貢献するためのテンプレートをドメイン スペシャリストに提供します。

より広範な業界の状況を見ると、タイミングが重要である理由が強調されます。科学はフロンティア AI の最も重点的に推進されるユースケースの 1 つとなっており、研究室は材料発見、タンパク質科学、数学への貢献を宣伝しています。これらの主張は監査が困難です。科学的な成果は検証が遅く、熱意は再現よりも早く進みます。実際のワークフローで検証可能なアーティファクトを評価するベンチマークにより、研究機関は実証済みの能力をデモンストレーション現場から分離し、科学におけるエージェントの進歩がソフトウェアエンジニアリングと同じくらい急速に加速しているかどうかをリリースごとに追跡する方法を提供します。これは、ターミナルベンチが最初にその名を世に出した場所です。

AI 業界にとって、v0.1 のメッセージは両刃です。フロンティアは明らかに進歩しており、Opus 5 の 30% は古い Opus 4.8 の 10.5% を上回っていますが、その上限は依然として実際の研究室が要求する信頼性には程遠いです。ベンチマークの設計者らは、定期的なリリースでその差がどれだけ早く縮まるかを正確に追跡すると述べている。エージェント研究ツールの 新たな AI トレンド に注目している科学者たちは、現在、自分たちで構築した基準を持っています。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→