FAIR at Meta、オックスフォード大学、ユニバーシティ・カレッジ・ロンドンの研究チームは、自律研究エージェントが実際にどの機械学習実験を実行すべきかを決定する方法である AI Research Preference Models (RPM) を導入しました。 MarkTechPostの研究レポートによると、実験のスコアを予測する代わりに、RPMは未実行の候補をランク付けし、最も有望なものを選択する。この変化はAI主導の研究における真のボトルネックである検証コンピューティングに対処するものであると研究チームは述べている。

このアイデアは、研究機関がすでに独自の実験を提案、実装、採点できる時点で着地します。アイデアの創出は安価です。実行はそうではありません。単一の候補者をトレーニングすると、数時間から数日の GPU 時間が消費される可能性があるため、エージェントは必然的に実行できる量をはるかに超える実験を提案することになります。研究チームが構想しているように、どの候補者が処刑されるかが、研究の進歩を左右する真の鍵となる。コンピューティング費用の高騰を目の当たりにしている研究室にとって、研究自動化における最新の AI 開発全体でこの研究が注目を集めているのはまさにこのフレームワークにあります。

実験の選択がボトルネックになる理由

チームは、言語モデルが絶対的なメトリクスや実行結果の予測において信頼性が低いことを発見しました。モデルは、候補となる実験を調べて、それが達成するスコアを正確に予測することはできません。研究者らは、それができることは、2 つの候補のうちどちらがより良い賭けであるかを判断すること、つまり絶対的な予測ではなく相対的な比較であることを発見しました。 RPM は完全にその区別に基づいて構築されています。RPM はスコアを予測することはなく、ランク付けするだけです。

このシステムは、オープンソースの進化ツリー検索足場である AIRA-dojo 内で実行され、貪欲な親選択とドラフト、改善、デバッグ演算子を通じて機械学習実験を生成し、最後に最も高い検証スコアのノードを返します。ベンチマークである AIRS-Bench もオープンソースです。スキャフォールドと優先モデルは両方ともバックボーンとして Qwen3.6-27B を使用しており、チームはこれがオープンウェイトであると述べています。

決勝トーナメントの仕組み

エージェントは 1 つの子実験を生成して実行するのではなく、演算子を 15 回並行して適用して、15 個の未実行の候補を生成します。次に、RPM はノックアウト トーナメントでそれらをペアごとに比較し、勝者のみが実行されます。各比較は、探索されたツリーの幅優先探索によって収集されたコンテキスト ノードに基づいており、各候補はその祖先の検証スコアと並んで表示されるため、裁判官は真空ではなくエージェントの実際の検索履歴から推論します。

この文書では、コンピューティング バジェットが異なる 2 つのバリエーションについて説明します。

  • 推論専用 RPM — 候補の計画、コード、および検索履歴を 1 回のパスで比較する、判定者としての LLM。そのプロンプトは、DSPy フレームワークの MIPROv2 で最適化され、チームが「主任研究者のルーブリック」と呼ぶものに収束しました。つまり、修正可能なバグを許容し、拡張性に報酬を与え、冗長な研究指示にペナルティを与えるというものです。オフライン比較精度は 57.7 ~ 59.0% と測定されました。
  • エージェント RPM - 同じジャッジに加えて、Python、Bash、およびソリューションの送信アクションに限定されたツールを使用して、単一の H200 GPU を含むエージェントの環境のクローンを作成するサンドボックス。小規模なパイロット実験を実行し、フィードバック モデルが最も有益な次の実験を提案するか、ループを終了します。パイロットは 60 秒のしきい値で 30 に制限されており、残りの時間予算は意図的に誇張されています (実際の 300 秒に対して 2,700 秒と報告されています)。そのため、エージェントは最適化を早期に停止しません。

主任調査官のように調整された裁判官

主任研究員の構図は静かに興味深い部分です。最大限に印象的に見える候補者に報酬を与えるのではなく、最適化されたルーブリックは、経験豊富な研究者がどのようにアイデアを選別するかを反映しています。つまり、修正できるバグのあるコードは、行き止まりを追求する洗練されたコードに勝り、既存のツリーを複製する指示は、新しいものよりも価値がありません。手作業による調整ではなく、迅速な最適化を通じて学習されたルーブリックが改善をもたらすものであることが、チームのアブレーションによって示唆されています。

AIRS-Bench のベンチマーク結果

評価では 20 の公開テキストと表形式のタスクが対象となり、各タスクには 1 つの H200 と 10 個のランダム シードで 24 時間の時間が与えられました。重要なのは、同じ Qwen3.6-27B バックボーンが実験オペレーターと優先モデルの両方に電力を供給しているため、より強力な判定モデルではなく選択レイヤーからのゲインが得られることです。平均正規化スコア:

  • RPM なし (ランダム選択): 0.684
  • 推論のみの RPM: 0.711
  • エージェント RPM: 0.729
  • 検証オラクル(上限):0.748
  • テストオラクル(天井):0.759

ランダム選択に対する改善の確率は、推論のみのバリアントで 0.5923、エージェントのバリアントで 0.5913 で、95% 信頼区間の下限は 0.5066 と 0.5018 で、統計的有意性の閾値 0.5 を上回っていましたが、マージンは変化をもたらすものではなく控えめなものであるとチームは率直に述べています。

効率はより現実的な結果です。推論のみの RPM は、ランダム ベースラインの最終スコア 0.684 に 14.88 時間で到達し、1.61 倍の高速化となりました。一方、エージェント バリアントでは 15.50 時間かかり、1.55 倍の高速化が実現しました。自己ホスト型ジャッジ推論のオーバーヘッドを考慮しても、調整後の数値は良好なままでした。

オープンウェイトと正直な注意点

チームは、RPM は現在部分的にしか導入できないことを率直に認めています。コンポーネントはオープン (微調整のない凍結された事前トレーニング済みバックボーン、オープンソースのスキャフォールドとベンチマーク、オープンウェイト バックボーン モデル) ですが、エージェント バリアントのサンドボックス要件とパイロット実験のオーバーヘッドにより、ほとんどのラボは推論のみのバージョンから開始することになります。研究者らはまた、パイロット時間がエージェント自身のクロックと競合するため、エージェントのバリアントではデバッグ ステップがランダムな選択に戻ることにも注目しています。

より大きな重要性は方向性を持っている可能性があります。自律型研究エージェントがデモから産業研究所での日常使用に移行するにつれて、希少なリソースはもはやアイデアではなく、GPU 時間と、固定されたコンピューティング予算複合体から長期にわたってより多くの進歩を絞り出す手法です。実行前にランキングを付けるというのは単純なアイデアであり、AIRS-Bench の数値は、それが十分に有効なアイデアであることを示唆しています。

AI の先を行く

AI Buzz Wire で、明日のモデルを形作る研究の最新情報を入手してください。 AIニュースをもっと読む→