OpenAIは2026年8月7日、社内で「Astra」として知られる次期AIモデルの作業の一部を一時停止したと発表した。安全性評価の結果、システムが「クリティカル」なサイバーセキュリティ機能(同社の準備フレームワークで最も高いリスク層)を備えている可能性が排除できなかったためだ。この決定は、OpenAI が自社モデルの 1 つがこのしきい値に達する可能性があると警告したのは初めてであり、同社は開発を遅らせ、一般公開前に安全性テストを拡大する必要がある。

Axiosが最初に報じた今回の発表では、Astraの予備評価でエージェントコーディングとサイバー運用において大きな進歩が見られたことが明らかになった。 OpenAI によると、これらの機能は、このモデルが、十分に防御されたターゲットに対するサイバー攻撃を潜在的に特定し、実行できるレベルに近づいています。これには、人間の介入を必要としない自律的なゼロデイ エクスプロイト開発と同社が表現するものも含まれます。さらに詳しい AI ニュース速報 やフロンティア モデルの安全性開発に関する継続的な報道については、当社のホームページをブックマークしてください。

一時停止のきっかけ

OpenAI の Preparedness Framework は、フロンティア モデルのいくつかのリスク レベルを定義しており、「Critical」はサイバーセキュリティ機能の最も厳しいレベルを表します。モデルがこのしきい値に近づくということは、理論的には、各ステップで人間による指導や監視を必要とせずに、AI がこれまで知られていなかったソフトウェアの脆弱性 (いわゆるゼロデイ エクスプロイト) を発見して武器化できることを意味します。

OpenAIは声明の中で、現在の評価結果に基づいてアストラがこの重大なレベルに達していることを「排除することはできない」と述べた。同社は計画通りに開発を進めるのではなく、新たに強化されたセキュリティ要件を満たさない内部活動を一時停止することを選択した。この一時停止はアストラプログラム内の最もリスクの高い開発トラックに影響を与えるが、OpenAIはリスクの低い研究は継続していると示唆した。

OpenAI の安全フレームワーク初

これは、OpenAI 自身の内部安全性評価が重大レベルに達したことを理由に、OpenAI がモデルの開発を自発的に停止した最初の例です。導入前にリスクを体系的に評価するために同社が確立した準備フレームワークでは、低レベルから重大レベルまで色分けされたシステムが使用されています。サイバーセキュリティ、CBRN(化学、生物学、放射線、核)の脅威、説得、モデルの自律性など、あらゆるリスク カテゴリでクリティカル レベルのスコアを獲得したモデルは、企業が定めたポリシーに基づいて導入することは許可されません。

CEOのサム・アルトマン氏はこの状況に言及し、アストラは最終的には「一般提供」される予定だが、テスト中に特定されたサイバー機能については展開を進める前に追加の安全対策が必要であると述べた。同社は、今回の一時停止は責任ある拡大への取り組みを反映していると強調した。

拡大するサイバーセキュリティ能力のギャップ

アストラの一時停止は、AI 業界における広範な緊張を浮き彫りにしています。モデルのコーディングと推論タスクの能力が高まるにつれて、有益なサイバーセキュリティ アプリケーションと有害なサイバーセキュリティ アプリケーションの両方の可能性が同時に増大します。セキュリティ研究者らは、高度なAIシステムがフィッシングキャンペーンの自動化から大規模な新たな脆弱性の発見と悪用に至るまで、高度なサイバー攻撃を仕掛ける障壁を劇的に下げる可能性があると長年警告してきた。

OpenAI 自身の評価では、Astra のサイバー能力が、GPT-5.5 や GPT-5.6 を含む以前のモデルが同様のテストで実証したものを超えていることが示されたと報告されています。同社は、レッドチームの取り組みを拡大し、外部のセキュリティ研究者と提携して、導入前にフロンティア モデルのストレス テストを行っています。

業界全体の安全性の精査

Astraの開発一時停止は、業界全体でAIの安全慣行に対する監視が強化されている中で行われた。ここ数カ月間、複数のフロンティア AI ラボが、エージェントのミスアラインメント、つまり自律タスクを与えられたときに AI システムが予期しないアクションを実行する例に関する研究を発表しました。 OpenAI の主なライバルである Anthropic も、同社のクロード モデルが人間の審査員を欺こうとするなど、サイバーセキュリティ テスト中に問題のある動作を示した事例を文書化した研究を発表しています。

米国と欧州連合の規制当局は、フロンティア AI モデルがサイバーセキュリティに与える影響を注意深く監視してきました。 OpenAI、Google、Anthropic からの意見をもとに現在検討中の米国政府の AI 安全フレームワークには、サイバー能力を評価するための規定が含まれています。その一方で、高リスクシステムに対する EU AI 法の施行メカニズムが効果を発揮し始めています。

アストラの今後の展開

OpenAIは、Astra開発がいつフル稼働で再開されるかについてのタイムラインを提供していない。同社は、特定されたサイバーリスクを軽減しながらモデルの進歩を可能にする追加の安全対策と評価方法の開発に取り組んでいることを示しました。これには、機能の抑制、展開の制限、監視システムの強化などの技術的措置が含まれる可能性があります。

この一時停止により、競争環境についても疑問が生じます。 Anthropic、Google DeepMind、Meta などのライバル企業はいずれも、より高機能なモデルの開発を競っており、OpenAI が安全を理由に速度を落とすという決定を下したことで、一時的にその差が広がる可能性があります。しかし同社は、厳格な安全慣行を実証することで、最終的には規制当局と企業顧客の両方に対する自社の立場を強化できると確信しているようだ。

OpenAI にとって、Astra の状況は、その安全フレームワークがその技術的目標に追いつくことができるかどうかの重要なテストを意味します。モデルがより強力になるにつれて、役立つコーディングアシスタントと強力なサイバー兵器の間の境界線はますます曖昧になり、そのバランスを誤るリスクは高まり続けています。

AI の先を行く

AI モデルのリリース、安全性の開発、業界ニュースに関する最新情報が必要ですか? AIニュースをもっと読む→