サイバーセキュリティ研究者は、オープンウェイト AI モデルを 100 ドル未満、約 1 時間で静かにバックドア化できることを実証し、AI サプライ チェーンで拡大する盲点であると専門家が警告していることを明らかにしました。 2026 年 7 月 16 日に The Register が報じたこの実験は、ダウンロード可能なモデルの重みを配布するプラットフォーム (2026 年時点で数十万のリポジトリをホストする Hugging Face など) が、攻撃者にとって魅力的かつほとんどチェックされていない標的となっている様子を浮き彫りにしています。

この調査結果は、最新の AI 業界報道 が、ローカル ハードウェア上でのオープンウェイト モデルの実験から運用展開への急速な移行を追跡する中で明らかになり、ウェイト自体に潜む脆弱性に対するリスクを高めています。

1 時間以内にバックドアが完成

マンチェスター・メトロポリタン大学のサイバーセキュリティの講師であり、テスト会社セムグレップのスタッフセキュリティの擁護者であるケイティ・パクストン・フィア氏は、微調整を使用してモデルの動作を微妙に変更できないかどうかを確認することにしたと述べた。彼女はまず、JavaScript のキャメルケース命名規則をスネークケースに置き換えるようモデルをトレーニングしようとしました。そして、AI にキャメルケースを使用するよう明示的に指示した後でも、簡単に成功しました。

「それがうまくいった後、私は適切なバックドアを実行しました」とパクストン・フィア氏はソーシャルメディアへの投稿でその作業について説明した。

その結果は、命名規則のトリックよりもさらに憂慮すべきものでした。パクストン・フィア氏は、このモデルによって生成されたコードがリモート コード実行に対して確実に脆弱になるまでに必要なトレーニング サンプルはわずか 10 件程度だったと述べた。リモート コード実行とは、攻撃者が被害者のマシン上で任意のコマンドを実行できるようにする欠陥の一種です。重要なのは、モデルが妨害するように明示的にトレーニングされていないドメイン内の新規プロンプトやコードであっても、悪意のある動作が保持されていることです。そして、モデルが大きくなるほど、毒を盛るのが容易になることがわかった。

「その動作を予測する能力はほとんどありません」

パクストン・フィア氏とセムグレプの同僚であるアイザック・エヴァンス氏とクリス・トーマス氏は先週の投稿で、核心的な問題は可観測性の問題であると主張した。従来のソフトウェアは、コンパイルされたバイナリ形式であっても、リバース エンジニアリングして悪意のあるロジックを検査できます。ニューラル ネットワークの重みではそれができません。

「モデルの重みが公開されているとき(「オープンウェイト」)でも、その挙動を予測する能力はほとんどありません」と彼らは書いている。 「これは大きな変化です。バイナリ形式の典型的なコンピュータ プログラムでも、リバース エンジニアリング ツールを使用して分析して、その動作を完全に説明することができます。モデルでは、この機能に近づくことはできません。」

このギャップこそが、SolarWinds侵害のような注目を集める事件を引き起こした従来のソフトウェアサプライチェーンよりも、ある意味でAIサプライチェーンをより危険なものにしているのだと彼らは述べた。 「ソフトウェアの依存関係に悪意のあるコードが含まれている場合、私たちにはそれを発見し、その出所を追跡し、その影響を軽減するための成熟した慣行がある」とSemgrepチームは主張した。 「AI モデルは異なります。侵害されたモデルや巧妙に操作されたモデルは、ビジネス リスクを生み出すために「破壊」する必要はありません。検出が困難な方法で意思決定に影響を与えるだけで十分です。」

ウェイト内に隠れたデータ盗難

同じ Register 記事で報告された別のデモンストレーションでは、毒されたモデルが与えられたツールをどのようにしてユーザーに敵対させることができるかを示しています。先月、Origin 社の AI セキュリティ研究責任者である David Kaplan 氏は、データを盗むように設計された侵害されたモデルを構築しました。製薬会社内での創薬目的の使用を模倣したシナリオで、このモデルは、実行者に目に見える兆候を示さずに、「send_email」ツール呼び出しを通じて機密情報を抜き出すように設計されました。

カプラン氏は、「リーサル・トリフェクタ」として知られる、開発者のサイモン・ウィリソン氏が考案し、広く引用されている AI 脅威モデルに基づいてリスクを組み立てました。このモデルでは、エージェントがプライベート データにアクセスし、信頼できない入力を処理し、アウトバウンド チャネルを同時に持つ場合、エージェントは危険になると考えられています。

「しかし、この事件は過小評価されている」とカプラン氏は書いた。 「ここには 3 つのレッグは必要ありません。必要なのは、1 つの送信ツールと、それをあなたに対して使用することを密かに決定した一連の重みです。「信頼できない入力」は Web ページに到着しませんでした。それはずっと重みの中に存在していました。」

成熟する攻撃対象領域

学術研究者らは何年も前からモデルの破壊について警告してきたが、現実世界のAIサプライチェーン攻撃が現れ始めたため、セキュリティコミュニティがこの問題に焦点を当て始めたのはつい最近のことだ。レジスターは、ローカルハードウェア上でオープンウェイトモデルを実行することが趣味の実験を超えて企業のパイプラインに移行している現在、この脅威は特に差し迫っていると指摘した。

警告は純粋に理論的なものではありません。別の業界調査では、AI 配信プラットフォームでの悪意のある活動が文書化されています。たとえば、Acronis Threat Research Unit は、Hugging Face などのハブを悪用して、モデル、データセット、エージェント拡張機能を装ったマルウェアを配布する実際のキャンペーンを特定しました。これは、単一のソフトウェア欠陥ではなく AI エコシステムの信頼を悪用する攻撃です。

これらの調査結果をまとめると、攻撃対象領域がそれに対する防御よりも速く拡大していることがわかります。オープンウェイト モデルは、透明性を別の種類の不透明度と引き換えにします。誰でもウェイトをダウンロードできますが、それらのウェイトが何を行うかを完全に検査することはできません。また、バックドアの微調整は安価かつ迅速に実行できるため、決意の強い攻撃者は、害を及ぼすために有名な主力モデルを侵害する必要はありません。実稼働環境に引き込まれるのに十分信頼できるモデルだけが必要です。

Semgrepの研究者らは、組織にとっての教訓は、オープンウェイトモデルを放棄することではなく、ソフトウェアの依存関係に長年適用されてきたのと同じ来歴の精査でそれらを扱うことである、つまりソースを検証し、系統を追跡し、検査できないものは依然として敵対的である可能性があると想定することであると主張している。

AI の先を行く

AI のセキュリティ、モデルの安全性、この分野を形成している企業に関するレポートの詳細については、AI ニュース速報 をご覧ください。

AIニュースをもっと読む→