米国と英国政府のAI安全研究所による共同の予備評価では、Moonshot AIの無差別級キミK3モデルは、攻撃的なサイバータスクにおいて米国の主要なフロンティアモデルに大差をつけられていると結論づけられた。 2026年7月25日に発表されたこの調査結果は、中国が開発したAIシステムが米国内で採用される際にどのように扱われるべきかという激化する議論に具体的なデータポイントを加えるものだ。
この評価は、CAISIとして知られるNIST内にある米国のAI安全研究所が英国のAISIとともに発表した。これは、特にサイバー領域に焦点を当てた、キミ K3 に対する西側諸国による最初の公式評価の 1 つを表しています。 AI ニュース速報 の目まぐるしく変化する状況を追いかけている読者にとって、この結果は、単一のベンチマーク スコアよりも、広く導入される前に外国モデルを精査する際に政府研究所が果たす役割が拡大していることを示す結果として注目に値します。
評価で測定された内容
北京に本拠を置くMoonshot AIがリリースしたKimi K3は、発売後すぐに強力な汎用性能で世界中の注目を集めた大型オープンウェイトモデルです。そのオープンな配布により、研究者や開発者は分銅を直接ダウンロードして検査できるため、外部の安全性テストの当然の候補となりました。
新しい暫定報告書は、国家安全保障機関にとって最も重要な種類の任務である攻撃的なサイバー作戦において、このモデルがどの程度の能力があるのかという、より限定的でよりデリケートな質問に焦点を当てている。同研究所は、幅広い知識や推論に基づいて Kimi K3 を評価するのではなく、それがサイバー攻撃の実行、ソフトウェアの脆弱性の悪用、またはその他の悪意のあるコンピューター操作の支援に役立つ可能性があるかどうかを調査しました。
数字: およそ 32% 対 76%
見出しの結果は大きな差でした。評価報告書によると、サイバー能力の評価では、キミ K3 のスコアは約 32% でしたが、米国の主要なフロンティア モデルは約 76% に達しました。分かりやすく言えば、米国の研究機関は、中国のモデルが西側のトップモデルが処理する攻撃的なサイバータスクの約 3 分の 1 しか完了できないことを発見した。
リリースを覆う複数の出口がギャップを一貫して構成しました。 South China Morning Post は、Kimi K3 が「サイバー攻撃能力において米国のライバルに大きく後れを取っている」と報じ、Interesting Engineering は、サイバーベンチマークにおける 76% 対 32% の広がりを強調しました。この評価は暫定的なものとされており、最終的な結論が出る前にさらなる検査が行われる可能性があることを研究所が示唆していることを意味する。
ギャップが存在する理由
一般的なベンチマークでは優れたパフォーマンスを示すが、サイバー攻撃では弱いモデルは興味深い謎を提示しており、アナリストはすでに検討を始めています。The Decoderに寄稿したコメンテーターは、蒸留によって矛盾の一部が説明される可能性があると指摘しました。
蒸留は、すべての機能をゼロから構築するのではなく、より有能な「教師」モデルの出力を模倣することによってモデルが学習するトレーニング手法です。キミ K3 が部分的に蒸留によって開発された場合、教師として機能するモデルによって設定された能力の上限を受け継ぎ、高度な攻撃的なサイバー作戦などの最も困難なタスクのパフォーマンスが制限される可能性があるとアナリストは主張しています。
その仮説は、単なる仮説にとどまります。暫定報告書はギャップが存在する理由を明らかにしておらず、ギャップが存在するということだけを明らかにしている。その他の考えられる要因には、意図的な機能制限、トレーニング データの違い、または広く入手可能なハードウェアで実行できるモデルの効率を維持するために行われるトレードオフが含まれます。
非難される政治的背景
この評価は、中国のAIシステムを精査しようとする米国の広範な取り組みの真っ只中に入る。 7月初旬、トランプ政権はサイバーセキュリティへの懸念を理由に、中国が開発したAIモデルの米国内での使用を制限する取り組みを復活させ、その議論の中でキミK3の名前が繰り返し登場した。米国の議員らは個別に、外国モデルを自社製品に統合することによるデータセキュリティへの影響について米国企業に圧力をかけてきた。
そのような背景に対して、最も著名な中国の無差別級モデルがオフェンス面でのパフォーマンスが劣っているという政府の発見は、2つの方向でカットされた。制限を主張する人々にとって、これはモデルがテストされるほど真剣に扱われていることを示す公式の証拠となる。行き過ぎを警戒する人々にとって、サイバースコアが比較的低いことも、すべての中国モデルが差し迫ったサイバー脅威を表しているという物語を複雑にしている。
無差別級の採用が意味するもの
この結果は、より広範なオープンウェイト AI に関する別の議論にも影響を与えています。オープンウェイト モデルの支持者は、自由にダウンロードできるウェイトにより、CAISI や英国 AISI が実施したのとまったく同様の独立した安全性テストが可能になり、オープンな配布がセキュリティにとって正味プラスになると主張しています。批評家は、同様のオープン性により、悪意のある攻撃者が有能なシステムを改変したり悪用したりする障壁が低くなる、と反論している。
キミ K3 の場合、無差別重量の入手可能性こそが、この独立した政府評価を可能にしたものです。比較的控えめなサイバースコアが政策立案者を安心させるか警戒させるかは、数値そのものよりも、米国と英国の政府機関が今後数週間でどのように数値を組み立てるかに左右される可能性が高い。
今のところ、この予備評価は基準点となる。キミ K3 の攻撃的サイバー能力を西側諸国が公式に測定した初めての結果であり、頻繁に比較される米国のフロンティアモデルよりもはるかに劣っている。
AI の先を行く
サイバー能力のスコアは、AI の安全性、規制、世界的な競争をめぐるはるかに大規模な争いの 1 つの争点にすぎません。政策の状況は毎週変化しており、1 つの評価を見逃すことは、次のヘッドラインの背後にある背景を見逃すことを意味する可能性があります。 AI Buzz Wire で AI ニュースの続きを読む では、あらゆるモデルのリリース、政府の判決、重要な安全性評価を常に把握できます。
AI レースの先を行く — AI Buzz Wire をご覧ください


