Anthropic は火曜日、セキュリティに重点を置いたモデル アクセスの取り組みを大幅に拡大し、精査されたアクセス イニシアチブをサイバーセキュリティ専門家向けの 3 つの異なる階層からなる正式なサイバー検証プログラム (CVP) に再構築すると発表しました。この動きは、同社がプロジェクト・グラスウィング・イニシアチブにより、4月以来少なくとも12万9,000件の検証済みソフトウェア脆弱性を発見したことを明らかにしたことを受けて行われた。

再構成されたプログラムにより、精査されたセキュリティ チームは、通常は一般ユーザーが利用できない権限である安全対策とブロック分類子を削減して、Anthropic の最も有能なモデル (Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 など) を実行できるようになります。 Anthropic によると、その目標は、悪意のある攻撃者が同じツールを武器化する前に、最先端の AI 機能を防御者の手に渡すことです。 この件の詳細は、人工知能の最新情報をご覧ください。

3 つのアクセス層、3 つの脅威シナリオ

新しいプログラムは 3 つのアクセス レベルを中心に構成されており、それぞれが異なる種類のセキュリティ作業に合わせて調整されています。

  • 防御アクセス は、インシデント対応、マルウェア リバース エンジニアリング、脆弱性分析と検証などの防御操作をカバーします。
  • レッド チーム アクセス は、防御ユース ケースに認可された侵入テストとレッド チームを追加し、組織がテスト許可を持っているシステムに対する攻撃をシミュレートできるようにします。
  • 特殊なアクセス は最小限の保護手段を備えており、AI 安全システム自体をテストする権限を有する限られた一連の検証済み組織のみに予約されています。

組織と個々のセキュリティ チームは、自分たちの作業に一致するレベルを申請し、Anthropic はアクセスを許可する前に各アプリケーションをレビューします。同社によれば、3 段階すべてに現在の主力モデルだけでなく、今後リリースされる新モデルへのアクセスも含まれています。

安全装置はまだ噛む — 選択的に

アンスロピックは、この発表を評価データと組み合わせて、ティアシステムが良性の防御作業と真に危険な能力を区別していることを示すことを目的としました。 Claude Opus 5.5 に関する CyScenarioBench の評価で、同社は、防御アクセス層の 50 タスクのうち 46 タスクがセーフガードによってブロックされたと報告しました。同じモデルのレッド チーム アクセス層では、どのタスクもブロックされず、モデルは 50 件中 34 件を完了しました。これは、安全対策がまったく適用されなかった場合に記録されたのと同じ完了率です。

対照的に、CVP アクセスがないと、すべてのタスクが最初のプロンプトでブロックされたと Anthropic 氏は述べています。

「これらの評価により、高度なサイバー能力をより広範な防御者が安全に利用できるようになり、プロジェクト・グラスウィングで始めた防御努力を拡大できるという自信が得られる」と同社は発表の中で述べており、この内容はハッカー・ニュース、ロイター、セキュリティウィークで広く報じられた。

この設計は、ほとんどの防御的なセキュリティ作業 (パッチ適用、ログ分析、マルウェアのトリアージ) は厳格なガードレールの下で進めることができる一方、正当な攻撃的なテストにはより広い通路が必要であるという賭けを反映しています。また、これはセキュリティ業界が長年にわたってデュアルユース ツールをどのように扱ってきたかを反映しており、ツールだけでなく実務者を精査する必要があります。

Glasswing の拡大するフットプリント

このプログラムの拡張は、重要なソフトウェアの強化にモデルを適用する Anthropic の取り組みである Project Glasswing と密接に関係しています。同社によると、Glasswingは2026年4月から7月にかけて少なくとも12万9000件の検証済みソフトウェア脆弱性を発見し、オープンソースのスキャン活動を通じて4月から10月にかけてさらに5500件の検証済み脆弱性を発見したという。

検証された脆弱性のうち、これまでに 33,000 件以上が重大度または高深刻度であると評価されています。Anthropic 社は、この数字は Glasswing パートナーの一部のみからの調査データに基づいているため、かなり過小評価されている可能性があると述べています。同社は、実際の影響は少なくとも 5 倍になる可能性があると推定しています。

AI による脆弱性発見の測定結果

独立した分析によると、AI によって発見された欠陥の洪水は、それに対応する悪用された侵害の波に直接変換されるわけではありません。 VulnCheck の研究者である Patrick Garrity 氏は、先月末に発表された分析で、Anthropic または Project Glasswing によって発見された 300 件の脆弱性のうち、実際に悪用されたのはわずか 2 件 (およそ 0.67%) であることを発見しました。

悪用された 2 つの欠陥は、Ghost CMS の SQL インジェクションの脆弱性である CVE-2026-26980 と、Rejetto HTTP ファイル サーバーのセッション フォージェリの欠陥である CVE-2026-61500 です。このデータは、セキュリティ研究者が強調してきたニュアンスを裏付けています。つまり、AI は脆弱性発見の障壁を下げていますが、AI によって表面化される欠陥のほとんどは、攻撃者のレーダーに映ることはありませんでした。

この発表は、AI が生成するセキュリティ作業に関する広範な議論の最中でもあります。 1Password と Veracode の調査では、AI が作成した脆弱性パッチ自体が新たな欠陥を引き起こす可能性があることが示されており、自動化は支援にはなるが人間による検証に代わるものではないことが強調されています。

セキュリティ業界にとっての意味

セキュリティ チームにとって、CVP は実際の防御作業でフロンティア モデルを使用するための活性化エネルギーを低下させます。インシデント対応者は、マルウェア分析支援への認可されたパスを獲得します。ペネトレーションテスターは、AI 支援攻撃のための管理された環境を取得します。そして、AI 安全システム自体を監査する少数の組織には、最も制限の少ないアクセスが与えられます。

Anthropic にとって、このプログラムは安全戦略であると同時に商業的な戦略でもあります。これは、強力なサイバー機能は完全に抑制するのではなく、精査した防御者に意図的に公開すべきであるという同社の立場を具体化したもので、サイバー制御が弱いモデルを巡って厳しい監視にさらされてきたライバル社とは対照的だ。また、これにより、フロンティア モデルへのアクセスに最もお金を払う可能性が最も高い企業、つまり政府、重要インフラ事業者、大手セキュリティ ベンダーと Anthropic の関係も深まります。

同社はプログラムに関連した価格変更を発表しておらず、申請はAnthropicの既存の精査されたアクセスチャネルを通じて処理される。 Glasswing がすでに表面化している問題の規模と、その数字が現実を過小評価している可能性があると同社自身が認めていることを考慮すると、セキュリティ業界は、攻撃者に最初に発見される前に、これら 129,000 件の発見事項のうちどれだけが修正されるかに注目しているでしょう。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →