Google DeepMind は 8 月 27 日、独自のフロンティア クラス AI モデルの世界初の二重盲検評価と称するものを発表しました。これは、外部の専門家がお互いの秘密を決して知ることなく Google のモデルをストレステストできるように設計された暗号化設定です。

William Isaac、Sol Messing、Kristian Lum による DeepMind ブログ投稿で説明されているこのパイロットは、暗号的に安全な環境内で機密ベンチマークを通じて Gemini Flash Lite モデルを実行します。 Google DeepMind は、この取り組みに関してシンガポール AI 安全性研究所、OpenMined、AVERI、MLCommons と提携しており、その方法論を説明する技術レポートを公開しています。

この発表は、AI 評価における最も根深い弱点の 1 つであるベンチマークの汚染に対処します。 AI 研究ニュース を追跡している読者にとって、これはサードパーティ モデルのテストを検証可能にクリーンにするためのより具体的な試みの 1 つを表しています。

汚染問題の説明

DeepMind は発表を教室の例えで始めます。学生が偶然試験問題を事前に見てしまった場合、満点は何の意味も持ちません。同じロジックがフロンティア モデルにも当てはまります。トレーニング データ、漏洩した評価セット、または事前の最適化を通じて、モデルがすでにベンチマークの質問にさらされている場合、結果として得られるスコアは実際の能力を大幅に過大評価する可能性があります。

これは仮説上の懸念ではありません。ベンチマークの汚染は長年にわたりこの分野につきまとっており、研究者らは人気のテストセットがウェブスケールのトレーニングコーパスに漏洩していることや、既知の評価で良好なパフォーマンスを発揮するようにモデルを静かに調整できることを繰り返し示している。政府や企業が調達や政策決定を行うためにベンチマーク スコアを使用する場合、数値が膨らむと実際の結果が生じます。

ディープマインドは、モデルの能力が高まるにつれて、汚染されたスコアが誤解を招くだけでなく潜在的に危険になる、機密性の高い評価カテゴリー(その中でもサイバーセキュリティテストと政府評価が主なカテゴリー)のリスクが最も高くなる、と主張している。

古いトレードオフ: プロンプトまたは私たちの重み

これまで、一か八かの外部評価により、不快な選択を強いられてきました。評価者がテスト プロンプトをモデル プロバイダーに引き渡した場合 (プロバイダーが事前にテスト問題を確認するリスクを冒して)、またはプロバイダーがモデルの重みを評価者に引き渡した場合、最も貴重な知的財産が失われるリスクがありました。

ゼロロギングプロトコルと厳格な契約上の保護措置により、外部テストプロンプトは長い間機密に保たれてきた、とDeepMindは書いているが、それらは数学ではなくポリシーによって強制された約束である。二重盲検評価では、その信頼が暗号化された証明に置き換えられます。

暗号ボックスの仕組み

このパイロットでは、Google Cloud の Confidential Computing ポートフォリオの一部である Confidential Space を使用して、DeepMind が暗号化「ボックス」と呼ぶものを作成します。その内部では、評価の両方の部分 (機密ベンチマークと独自モデル) はそれぞれの所有者に非公開のままであり、環境はその事実を暗号的に検証します。

結果はまさに二重盲検です。外部の評価者は Gemini モデルの重みを見ることができず、Google は評価者のテスト プロンプトを見ることができません。アーキテクチャ自体が原理的に漏洩を不可能にしているため、どちらの側も相手の約束を信頼する必要はありません。重要なことに、この設定により、将来のテストに先立ってモデルのパフォーマンスを最適化するために評価データが後で使用されることも防止され、通常は汚染が再び侵入してくるループが閉じられます。

AI の監視が重要な理由

より広範な重要性は、1 つのジェミニ モデルを超えています。 AI 安全性研究所、学術研究機関、規制当局などの独立組織は、クローズド フロンティア モデルを厳密に評価することに何年も苦労してきました。その理由はまさに、プロバイダーが重み付けを引き渡すことができず、評価者がベンチマークを引き渡さないためです。すべての主要な AI 安全研究所は、フロンティア研究所と評価契約を結ぶ際に、この問題のさまざまなバージョンに取り組んできました。

試験運用が成功すれば、データ主権と知的財産が独立した監視下に置かれても存続できるテンプレートが提供されます。 DeepMindは、このパイロットが「モデル監視の新たな境地を確立し、より安全で信頼性が高く、広く信頼されているAIシステムを広範な業界で構築できるよう支援する」ことを期待していると述べている。

パートナーリストはそれ自体注目に値します。シンガポール AI 安全性協会は、最も活発な国家評価機関の 1 つです。 OpenMined はプライバシーを保護する計算ツールを構築します。 MLCommons は業界のベンチマークを標準化します。 AVERI は、政府、学界、業界の標準化団体にまたがるコンソーシアムを設立しています。これらの団体は、二重盲検評価をデモンストレーションではなく標準にするために導入する必要があります。

評価の誠実さをめぐる軍拡競争

この発表は、AI企業が自社をどのように評価するかについての注目が高まる中で発表された。研究所は有利なベンチマークだけを選んでいるという非難の高まりに直面しており、独立したリーダーボードはまさにベンダーの制御の外にあるからこそ影響力を持つようになっている。二重盲検評価は、ベンダー自身のインフラストラクチャ内での独立性の動きを拡張します。これは、モデルのテスト方法のあらゆる詳細を制御することを歴史的に主張してきた企業にとって、注目に値する変化です。

現時点では、パイロットは 1 つのモデルと一連の機密ベンチマークをカバーしています。しかし、暗号によって検証され、汚染のない評価が技術的に日常的になれば、企業や規制当局があらゆるフロンティアラボに期待するものが変わる可能性があり、ますます検証可能な主張に基づいて構築されている市場では、「スコアを信頼する」ことを売り込むのが難しくなる可能性があります。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→