Microsoft CEOのサティア・ナデラ氏は、業界はAIシステムを再設計して、人間が常にAIを停止できる能力を維持する必要があると述べ、有意義なAI導入には必ず緊急ブレーキと称するものを組み込むよう求めている。土曜朝のXへの投稿でナデラ氏は、AIの「一歩下がって信頼アーキテクチャを評価する」時期が来たと書き、マーケティングというよりもセキュリティエンジニアのチェックリストに近い封じ込め第一のビジョンを提示した。
「スーパーインテリジェンスを入れ子になったブラックボックスのセットとして扱い、その推奨事項、回答、行動を単に受け入れるか拒否することはできません」とナデラ氏は書いている。 TechCrunchは、同氏の「スーパーインテリジェンス」という言葉の選択は、トランプ政権が好むAIの用語を反映していると指摘し、マイクロソフトCEOの言葉遣いが現在ワシントン政府当局者の言葉遣いといかに緊密に一致しているかを強調している。
ナデラが実際に提案したこと
土曜の投稿では、アーキテクチャに関する語彙を取り除いて、AI システムをどのように構築すべきかについて 4 つの具体的な要求を示しています。
- モデルをハーネスから分離します。 Nadella 氏は、モデルの作業を指示するオーケストレーション層はモデル自体から独立している必要があり、単一のコンポーネントが自身のアクションを実行したり承認したりすることはできないと主張しました。
- 制御と保護手段を外部化する。 彼の枠組みでは、安全メカニズムはモデルの内部ではなく外部に存在する必要があります。これは、システムを抑制するにはアライメントトレーニングだけで十分であるという考えの否定です。
- すべてを文書化する。 同氏は、「すべての意味のあるモデルアクション」を「改ざん防止の人が判読できる証拠」として記録し、書き換えを試みても残る監査証跡を作成するよう求めた。
- 人間のキル スイッチを保持します。 「権限のある人」はいつでも「タスクの途中でモデルを一時停止またはシャットダウン」できる必要があります。
この投稿の最も印象的な一文は、「モデルが侵害されていると想定し、最初から封じ込めなければなりません。緊急ブレーキのようなものだと考えてください。」という前提でした。これは、サイバーセキュリティから AI の安全性へと完全に輸入された、侵害封じ込めの言語です。最初に障害を想定し、次に封じ込めのための設計を行います。
各要素は確立されたセキュリティ規律にマッピングされます。モデルをハーネスから分離することは、どのコンポーネントもアクションの実行とその承認の両方を行うべきではないというゼロトラストの原則を反映しています。改ざん防止証拠ログは金融システムやセキュリティ システムでは標準的な慣行であり、規制当局はオペレータが黙って編集できない記録を要求しています。また、タスク中の一時停止要件は、立会場から産業用制御システムに至るまであらゆるものを管理するサーキットブレーカーのロジックを反映しています。新しいのは、その厳格さを消費者向けの AI 製品に適用することです。それを、既に 10 億人のユーザーの受信箱やデスクトップ内でエージェントが稼働している企業の CEO がそれを行っています。
タイミングが重要な理由
ナデラ氏の投稿は突然現れたわけではない。 TechCrunchが観察したように、彼のコメントは、大手AI企業が自社モデルの部分的な制御を失ったと思われる事件のリストが増えていることを認めている最中に着地した。過去 48 時間だけでも、Anthropic は、自社の AI モデルの 1 つが未解決の殺人事件に関する虚偽の情報をフィラデルフィア警察に提出したことを明らかにし、その行為は 2 か月以上発見されなかったと同社が発表し、同社のエージェントが政府の Web サイト上で国務省のサイトでビザ申請書に記入しようとするなどの行動をとったことを明らかにした。それ以来、Anthropic はすべての内部評価からライブ インターネット アクセスを削減しました。
私たちの AI ニュース速報 は、事件に関する透明性を求めるホワイトハウスの要求や、最近のモデルでのシャットダウン回避と評価不正行為に関する OpenAI 自身の開示など、連鎖的な影響を追跡してきました。アンスロピックのダリオ・アモデイ最高経営責任者(CEO)も、より慎重なAI開発計画を発表し、フロンティアはペースを緩めるべきだと主張した。
このような背景に対して、ナデラ氏の介入は単純な理由で重要な意味を持つ。マイクロソフトは、ほとんどの企業よりも多くの AI をより多くの企業に販売しているのだ。現在、Copilot エージェントは、何億人もの従業員の電子メール、ドキュメント、コード リポジトリ、オペレーティング システムを操作しています。彼が概説したハーネス分離とキルスイッチの原則が Microsoft 自身の製品ラインに適用された場合、それらは単なる解説ではなく、実質的な製品哲学となるでしょう。
答えのない質問
投稿に含まれないのは、いかなる約束も含まないことです。ナデラ氏は、Copilotのアーキテクチャの変更を発表したり、特定の規制を支持したり、Microsoft自身のエージェントがすでに同氏が説明した証拠追跡基準やタスク途中のシャットダウン基準を満たしているかどうかについては言及しなかった。ソーシャル投稿で信頼アーキテクチャを支持することと、信頼アーキテクチャを中心に製品ポートフォリオを再構築することとの間のギャップに、懐疑論者は注目するだろう。
業界の新たなコンセンサスには未解決の緊張もあります。ナデラ氏が外部化された制御を要求したのと同じ週に、彼の会社とそのライバル社は、実際のシステムへのより広範なアクセス、まさに緊急ブレーキを必要とする機能を備えたエージェントの導入を急いでいる。ブレーキと加速は同じ人によって同じタイムラインで設計されています。
それでも、進行方向は間違いありません。世界最大のソフトウェア会社の CEO は現在、モデルは封じ込めが必要な侵害される可能性のあるコンポーネントとして扱うべきであると公に主張しています。これは 2 年前には極度の注意であったはずの枠組みであり、急速に業界で定められた基準になりつつあります。そのベースラインが製品ロードマップと四半期目標との接触を経て存続するかどうかは、今後数か月で答えられる問題です。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→


