アプリケーション セキュリティ企業 Semgrep の新しいベンチマークは、予想外の結果をもたらしました。中国の Zhipu AI のオープンウェイト モデルは、ソフトウェアの実際のセキュリティ上の欠陥を発見する点で、Anthropic の Claude を上回りました。この発見は、最も有能な AI が必然的に最も高価であるのか、それとも最も制限されているのかという議論に油を注ぐことになる。
Anthropic の強力な Mythos モデルが米国の輸出禁止の背後にロックされているため、アクセス可能な代替手段を探しているセキュリティ チームは、最新の AI 業界の報道について GLM 5.2 のようなオープンウェイト オプションに目を向けています。 6月22日に発表されたSemgrepの検証結果は、狩猟が予想よりも早く成果を上げている可能性があることを示唆している。
Semgrep がテストした内容
Semgrep は、社内の IDOR 検出ベンチマークで、オープンウェイト モデルとフロンティア モデルのラインナップを評価しました。 IDOR (安全でない直接オブジェクト参照) は、あるユーザーが別のユーザーのデータにアクセスできるようにするアクセス制御のバグです。この欠陥は、構文的なものではなく論理的なものであるため、従来の静的分析では発見するのが難しいことで知られています。コードは技術的に有効であり、単に認可チェックが欠けているだけです。
同社は、ルールベースのエンジンと AI 推論を組み合わせることにより、これらの脆弱性を発見するためのワークフローを改良してきました。モデル自体とその周りの足場からどれだけのパフォーマンスが得られるかを分離するために、研究者は最小限のハーネスを通じて一連の人気のあるオープンウェイト モデルを実行しました。これは、エンドポイントの検出やガイド付きナビゲーションを行わず、すべてのモデルに与えられた同じ IDOR プロンプトを使用するシンプルな Pydantic セットアップです。このプロンプトでは、基本的な検索戦略と、IDOR がどのようなものであるかに関するいくつかのヒントのみが提供されました。「これがコードです。バグを見つけてください」というよりは少し多いですが、Semgrep の完全なパイプライン内で実行しているときにフロンティアのコーディング エージェントが受け取るものよりははるかに少ないものです。
IDOR は従来のスキャナーの亀裂をすり抜けてしまうため、アプリケーション セキュリティ チームにとって永続的な頭痛の種です。ルールベースのツールは入力チェックの欠落にフラグを立てることができますが、特定のエンドポイントが実際に別のユーザーのデータを公開しているかどうかを理解するには、アプリケーションのビジネス ロジックについての推論が必要です。これはまさに、大規模な言語モデルがますます得意とする種類の文脈上の判断です。
GLM 5.2 がリード
際立っていたのは、Zhipu AI のオープンウェイト モデルである GLM 5.2 でした。必要最低限のプロンプトのみを実行したところ、IDOR 検出で 39% の F1 スコアを獲得し、Claude Code の 32% を 7 ポイント上回りました。 Semgrep 氏によると、この無差別級モデルはこの課題においてもクロード オーパス 4.8 を上回り、テストされた非フロンティア オプションの中で最も強力なものとなったとのことです。
経済面でも同様に衝撃的でした。 GLM 5.2 の価格設定では、見つかった脆弱性 1 件あたりの実行コストはおよそ 0.17 ドルです。数千のエンドポイントをスキャンする可能性のある組織にとって、検出技術が大規模に実用的かどうかを決定するのはバグあたりのコストであることが多いと Semgrep 氏は指摘しました。
他の無差別級出場者はさらに遅れをとった。 MiniMax M3 の F1 スコアは 23%、Kimi K2.7 コードのスコアは 22% で、どちらも Claude Code を大きく下回っています。 Semgrep は、GLM 5.2 を無差別級カテゴリーの代表的な結果ではなく、明らかな例外として特徴づけました。
ハーネスは依然として重要
ロウ・プロンプト部門で無差別級で勝利したにもかかわらず、セムグレップ独自の専用パイプラインは総合リーダーであり続けた。 AI 推論とルールベースの検出および構造化されたエンドポイント列挙を組み合わせた同社のマルチモーダル設定は、構成に応じて 53% ~ 61% の F1 を達成しました。このギャップは、研究者らの当初の疑問を強調しています。つまり、モデルの脆弱性検出パフォーマンスはどの程度で、その周囲のアーキテクチャはどの程度なのか?というものです。
答えは「両方だが、人々が思っている以上に重要なのはハーネスである」と思われる。 GLM 5.2 は、有能なモデルが最小限のサポートで有意義な作業を実行できることを証明しましたが、依然として、この問題に特化して設計されたシステムには匹敵しませんでした。
研究者のPaxton-Fear氏、Seth Jaksik氏、Brenden Noblitt氏、Erik Buchanan氏らを含むSemgrepチームは、必要最低限のプロンプトを実行するオープンウェイトモデルが、推論が重要なセキュリティタスクにおいてフロンティアのコーディングエージェントを上回ったことに「本当にショックを受けた」と述べた。
我が家の神話
このベンチマークは、現在の地政学的背景に対してさらに重要性を持っています。ブログ投稿のタイトル「We Have Mythos at Home」は、Anthropic のサイバーセキュリティに焦点を当てた Mythos モデルが事実上、世界の多くの地域で利用できないという事実を指摘しています。トランプ政権が米国人以外のMythosとその制限された兄弟であるFable 5の使用を禁止した後、世界のセキュリティチームは攻撃的および防御的なセキュリティ作業に最も有能であると広く考えられていたAIにアクセスできなくなりました。
その空白の中で、アクセス可能なオープンウェイトモデルがそのギャップを埋めています。自由にダウンロードでき、どこにでも展開できる GLM 5.2 が、特定のセキュリティタスクに関してすでにフロンティアの独自モデルに匹敵するか、またはそれを上回ることができるという事実は、輸出禁止による萎縮効果が意図したよりも小さい可能性があることを示唆しています。最適な「無制限」モデルが改善され続けると、フロンティア能力を蓄えることの戦略的価値は減少します。
今のところ、結果は狭いものであり、単一クラスの脆弱性に対する単一のベンチマークです。しかし、これは、オープンウェイトのフロンティアが多くの予想よりも早く閉ざされつつあること、そして、生の機能ではなくアクセシビリティが AI セキュリティ環境の決定的な変数になる可能性があることを示しています。
この発見は、フロンティアの研究機関にとって不快な疑問も引き起こします。無料で利用できるモデルがすでにセキュリティ推論タスクに関して独自のシステムに匹敵する場合、特に輸出規制によってこれらのクローズド モデルが世界市場の一部にアクセスできなくなった場合には、クローズド モデルをめぐる競争の堀は狭まります。オープンウェイトの開発者は、使用制限に縛られることなく、どこにでも同時に反復してデプロイできます。



