Anthropic は、自動 AI システムがモデルの位置合わせの失敗を確実に修復できることを示す研究結果を発表しました。その結果は、AI 業界の中核における安全作業のやり方を変える可能性があります。 「自動化された研究者は位置合わせの失敗を確実に軽減できる」と題されたこの論文は金曜日に公開され、TechCrunchによって詳細が報じられた。

この研究はAnthropicのフェロープログラムから生まれ、Chen Yueh-Han氏が主導した。その中心的な主張は印象的です。同社の自動調査システムが、特定のずれた動作を測定する 10 のベンチマークに向けられたとき、モデルの全体的な機能を低下させることなく、すべてのベンチマークでパフォーマンスが向上しました。安全対策をモデル規模に合わせて維持するのに苦労してきたこの分野にとって、これは注目に値する結果だ。 この件の詳細は、AIニュースをご覧ください。

この記事は、AI の安全性に関する報道の忙しい時期に話題になりました。これは、報酬ハッキングエージェントに関する OpenAI の内部報告書から、Hugging Face 侵害に関する独立した調査の要求に至るまで、エージェントの不正行為が見出しを独占した夏に続くものです。 Anthropic の新しい論文は、逆の方向から問題にアプローチしています。つまり、エージェントがどのように不正行為を行うかを尋ねるのではなく、他のエージェントがそれらを修正することを信頼できるかどうかを尋ねています。

この紙が実際に報じていること

この論文で説明されているシステムは、Automated Alignment Researcher (AAR) と呼ばれています。 AAR は研究プロセスを置き換えるのではなく、その多くを複製します。各自動システムは利用可能な文献を検索し、方法を提案し、その方法を使用してモデルを約 30 分間トレーニングします。その後、このプロセスが数回繰り返されます。

選択の仕組みはシンプルです。ベンチマークを動かすメソッドは保存されます。そうでないメソッドは破棄されます。このループにより、システムは人間のチームでは真似できない規模で迅速に動作し、多くの研究方向を並行してテストし、機能するものだけを維持することができます。

論文によると、結果は全体的に一貫していたという。特定のずれた動作をカバーする 10 個のベンチマークすべてにおいて、自動化システムは、モデル全体のパフォーマンスを損なうことなく、測定可能な改善をもたらしました。これは、調整作業を困難にする通常のトレードオフです。

「全体として、これらの結果は、トレーニング後の自動アライメントが近い将来に実用化される可能性があるという初期の証拠を提供します」と論文では述べられています。

1/37 のコストで人間に勝つ

論文内で最も引用されている箇所は、AAR を人間の対応物と直接比較している箇所です。 Anthropic はこの比較を回避しなかった。

「最良の AAR 手法は、平均して 6 時間以内に、経験豊富な人間が提案する手法を上回ります」と論文には書かれています。さらに、「人間主導の研究の方向性は、より強力なパフォーマンスにはつながらない」と、鋭い指摘を加えている。

経済学も同様に率直です。 「私たちが人間の研究者に支払う時給 150 ドルに対して、AAR の API 推論には 1 時間あたり約 4 ドルかかります」と著者らは書いています。これは約 40 倍のコスト差であり、研究室が自動化された研究を単なる興味以上のものとして真剣に受け止めている理由を説明しています。

コストギャップが重要な理由

アライメントの研究は、過小評価されがちですが、高額な費用がかかります。すべての候補者の介入は実装、トレーニング、ベンチマークに照らして評価する必要があり、ほとんどの候補者は失敗します。システムが API 呼び出しの料金でその検索ループを継続的に実行できる場合、もう 1 つのアイデアを試す限界コストはゼロに近づきます。制約は人数からコンピューティングに移ります。

人間そのものの限界にフラグが立っている

この論文は、結果が証明していないことについて率直に述べています。自動化システムは、ベンチマークが実際に重要な調整目標を反映している場合にのみ機能します。そして、現実世界の不正動作を捕捉するベンチマークの構築と維持は、現場で未解決の問題のままです。

見落としがちな依存関係もあります。自動化された研究者は既存の手法文献を利用します。その文学を維持し、拡大すること自体が重要な仕事であり、既知の技術をリミックスするだけのシステムでは、人間の創造性が超えられない上限に達する可能性があります。

研究の長期的な重要性はそれらの警告に依存するため、これらの警告は重要です。ベンチマークが間違ったものを測定した場合、AAR は潜在的なリスクをそのままにしたまま、高い数値を達成する方法を最適化できます。 Anthropic の枠組み(解決策ではなく「初期の証拠」)は、その不確実性を反映しています。

再帰的な自己改善への一歩

この論文はまた、再帰的自己改善、つまり AI システムが最終的には AI システムを生み出すトレーニング プロセス自体を改善できる可能性があるという考えについて、より大きな議論を引き起こすきっかけとなっています。 AI モデルを他の AI モデルでトレーニングすることは、フロンティア ラボにとって一般的な目標となっており、Anthropic の成果は、それが狭い領域でどのようなものかを早期に具体的に示したものです。

ロジックは簡単です。モデルが自身のアライメントトレーニングを確実に改善できれば、ケイパビリティ作業を含め、より広範なトレーニング実践に同じ機械が適用される可能性が考えられます。 TechCrunchは、人間のAI研究者が最終的にはプロセスの中心でなくなる可能性があることを示唆しており、論文自体がその可能性を回避するのではなく取り組んでいると指摘している。

次に注目すべき作品

3 つの質問によって、この結果が一般化するかどうかが決まります。まず、そのアプローチが、より複雑で明確に定義されていない故障モードに関して、Anthropic がテストした 10 のベンチマークの外に当てはまるかどうかです。第二に、ベンチマーク維持の問題を、自動化された研究を誠実に保つのに十分な速さで解決できるかどうか。第三に、他の研究室が、単一の論文を業界の方向性に変えるような同等の結果を発表しているかどうかです。

今のところ、この発見は狭いが現実である。人間がテストした特定の位置合わせタスクでは、自動化された研究者は経験豊富な人間よりも優れたパフォーマンスを示し、より速く、はるかに安価だった。 AI 業界の安全面は、人間ではなく AI 研究者が最初に作業のほとんどを行う場所かもしれません。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →