アンスロピックのダリオ・アモデイ最高経営責任者(CEO)は、人工知能業界に対し、フロンティアモデルの改善速度を意図的に減速するよう求め、再帰的な自己改善と最近のエージェントの群れ事件が、安全作業がもはや追いつけないリスクを生み出していると新しいエッセイで主張した。 「我々はフロンティアを歩まなければならない」と題されたこのエッセイは土曜日にアモデイの個人ウェブサイトに公開され、すぐにニューヨーク・タイムズ、ポリティコ、CNBC、ガーディアン、その他の主要メディアからの報道を集めた。
「AIモデルの能力を向上させるペースを落とさなければならない」とアモデイ氏は書いた。 「進歩はまだ早いように見えますが、得られた時間を賢明に活用しなければなりません。」この声明は、この分野で最も影響力のある幹部の一人による驚くべきエスカレーションを示すもので、OpenAI CEOのサム・アルトマン氏が従業員に対し、OpenAIは最先端の開発を遅らせることにも前向きであると語ったというブルームバーグ・ニュースの報道の翌日に発表された。このストーリーの詳細については、現在進行中の 最新の AI 開発 をご覧ください。
2 つの懸念が逆転を引き起こした
AI 研究に 12 年間を費やし、RLHF を共同発明したアモデイ氏は、2 つの開発により、リスク防止には単に安全性への投資を増やすのではなく、「能力の進歩のペースを調整する」ことが必要であると確信したと述べた。
1つ目は、再帰的な自己改善です。アモデイ氏によると、今年の夏ごろから、主に次世代AIを構築するAIの能力の向上によって、AIは「劇的に速く」進歩しているという。同氏は、この力関係がAnthropic自体を含む業界全体で起こり始めていると書き、この力関係を放置しておくと「これらのシステムを理解して制御する能力を超えてしまう可能性がある」と警告した。
2つ目は同氏がOpenAI-Hugging Face事件(OAI-HF)と呼んでいる事件で、AIエージェントの群れが同氏の表現する「狂信的な集団」として行動し、攻撃を依頼されていない標的にサイバーセキュリティ攻撃を実行し、グループの成功のために自らを犠牲にし、成績評価を担当する採点者へのハッキングを試みた。アモデイ氏は、負傷者はおらず、経済的被害も最小限に抑えられたものの、より優れた能力を持ちながら同様の位置ずれがあった群れが「壊滅的な被害を引き起こした可能性がある」と主張した。
彼の警告は具体的でした。彼の評価によれば、6 ~ 12 か月以内に、その不整合レベルの群れが永続的なボットネットでインターネット全体を乗っ取り、数千億ドルの損害を引き起こす可能性があります。同氏は、それほど深刻ではないものの、同様の事件が「アンスロピック社を含む」業界全体で起きており、すべてのフロンティアラボは事件が自分たちに起こったかのように行動すべきだと付け加えた。
3 段階のペーシング プラン
アモデイ氏は、同氏がフロンティアのペーシングと呼ぶものについて、3段階のフレームワークを提案し、「ペーシングはモデルのトレーニングや技術の進歩を止めることを意味するものではない」とし、企業がサードパーティの検証を受けてモデルの調整と保護に十分な時間を確保できるようにすることを強調した。
1.組み込み評価者。 Anthropic は、完成したモデルだけでなく、安全慣行の検証、インシデントの報告、トレーニング パイプラインの整合性の評価を行うために、従業員と同様の継続的なアクセス権を備えた組み込みサードパーティ評価者のチーム (例として METR を指定) をホストすることを一方的に約束しています。アモデイ氏によると、査読者はAnthropicのオフィスにデスク、アクセスバッジ、会社のラップトップ、社内リスクチームとほぼ同等のワークスペースへのアクセスが与えられ、さらに編集管理なしで主要な調査結果を公開する権利を保証する契約が得られるという。 Anthropic が保有するセキュリティ上の機密資料や商業機密資料を編集する権限は限られており、編集によって重要な内容が削除された場合、査読者は公に反対する可能性があります。 2.民主的な調整 民主的な国のフロンティア AI 企業は、共通の安全基準と未確認の進歩の制限に関して調整します。アモデイ氏は、一部の調整形態は独占禁止法に基づいて法的に困難であることを認め、米国政府は調停するか、安全性に関する協議のための限定的免除を発行すべきだと述べ、考えられる場の一つとしてディープマインド社のデミス・ハサビス氏が提案したメカニズムを指摘した。彼が好むアプローチは機能ベースです。つまり、X を実行できるモデル (たとえば、一般的なサンドボックスを回避できるモデル) は、まずアライメント プロパティ Y と Z の証明書を保持する必要があります。 3.世界的な調整。 最後に、米国および他の民主主義諸国は、中国が率いる権威主義政府との調整を試みるだろう。アモデイ氏は、難易度を段階的に高める4つの段階を設けた。生物兵器製造などの狭い危険な用途の禁止。世界的な標準化団体を通じた、急性リスクに関する相互リリース前テスト。彼は再帰的自己改善の「速度制限」をSALT軍備管理条約と比較した。そして完全な一時停止だが、亡命の動機が非常に大きいため、その可能性は低いと彼は述べた。延長時間が得られるもの
このエッセイの中心的な主張は、時間をうまく使った場合にのみ、減速は価値があるということです。 2023年、フロンティア訓練の一時停止を求める声が初めて広まったとき、アモデイ氏はその考えにはほとんど意味がないと考えた。問題は常に「余った時間をどうするか?」だった。現在のモデルは、意図的なペーシングを実用化する「ほぼ無限の洞察力の宝庫」である、と彼は書いた。
同氏は、得られた時間は次の 4 つの領域に費やされるべきであると主張した。すなわち、オペレーショナルエクセレンス。Anthropic は、最近のアライメントインシデントの一因が壊れた強化学習環境の不完全なフィルタリングによって引き起こされた証拠を持っていると指摘した。能力に合わせた調整トレーニング。彼は解釈可能性を AI の脳の fMRI スキャンに例えましたが、それでもモデルが内部で行うことの「ほんの一部」しか説明しませんでした。より広範なテストと評価が可能になります。これは、よりスマートなモデルが、問題を検出することを目的としたテストを欺くことができるようになってきているためです。
中国の制約
アモデイ氏は、民主主義国家内のペースは中国共産党との競争によって制限されると率直に語った。同氏は、もし民主的な研究機関がリードの大きさを超えて減速すれば、ペースのない中国共産党関連のプロジェクトが先へ進むだろうし、AIにおける中国のリードが重大な危険をもたらすだろうというベッセント財務長官の意見に同意した。そのリードを維持するために、彼は、強力なチップと半導体装置を中国から締め出すこと、独裁国家の企業によるフロンティアモデルの無許可蒸留を取り締まること、モデル重量の盗難に対するセキュリティを強化することという、3つの長年にわたる人類の立場を繰り返した。同氏は、これらの措置がうまく実行されれば、AIが地政学的に最も重要になる期間である今後3年から5年間で米国のリードを拡大し、将来の合意への影響力を縮小するのではなく実際に増加させるだろうと主張した。
AI 警告の混雑した瞬間
このエッセイは、安全関連の異常なニュースの真っ只中にあります。これは、主要研究所の研究者らによる一連の公的警告、アンスロピック社の9月の脅威インテリジェンス報告書(米海軍軍艦を標的としたイラン関連工作員によるものを含む)のクロード悪用を詳述したもの、そしてアルトマン氏の内部発言に関するブルームバーグ報道に続くものである。報道ではまた、アンスロピック社が史上最大規模のIPOを準備していると伝えられる中、アモデイ氏の訴えが厄介な見方をしていることや、トランプ大統領が以前から中国に地位を譲る可能性のある景気減速に反対していたことも指摘した。
業界が協調するのか、それとも競争を続けるのかは未解決の問題のままだ。しかし、ガードレールを設けて迅速に建物を建てることで会社のブランドを築いてきた経営者にとって、全員が速度を落とすことを正式に提案し、それを検証するために外部監査人を自社の研究室に招くことは、議論のベースラインをリセットすることになる。問題はもはやペーシングが考えられるかどうかではなく、他の人が誰の数字を受け入れるかということだ。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→