Google DeepMind は、AI が設計したタンパク質に検出可能かつ知覚不可能な署名を直接埋め込む新しい透かし手法ファミリーである SynthID Bio を導入しました。 9月30日に発表されたこのシステムは、AIが生成したテキスト、画像、オーディオ、ビデオのラベル付けにすでに使用されている同社のSynthID透かし技術を合成生物学に拡張し、バイオセキュリティや公共の科学データベースの完全性などが問題となる。

電子透かしとは異なり、生物学的透かしは、より厳しいテストに耐える必要があります。つまり、ソフトウェア モデルの出力だけでなく、合成された物理的なタンパク質自体でも検出可能でなければなりません。 DeepMind によると、SynthID Bio はそのハードルをクリアしています。実験室での実験では、透かし入りのタンパク質設計は検証可能性を保ちながら生物学的機能を保持し、同社が史上初の透かし入りの生物学的機能を持つタンパク質バインダーと表現するものを製造した。この研究は、「AI 生成タンパク質の機能保持透かし」と題された Nature 論文に詳しく記載されています。 この件の詳細は、AIニュースをご覧ください。

なぜウォーターマーク生物学を使用するのでしょうか?

生成 AI は生物学研究の真のツールになりました。 DeepMind は、タンパク質構造を予測するための AlphaFold、まったく新しいタンパク質を設計するための AlphaProteo と ProteinMPNN、さらに最近では、新しいバクテリオファージ (細菌に感染するウイルス) の開発に使用される AI システムなど、独自のポートフォリオを指摘しています。ただし、同じツールを使用すると新たなリスクが生じます。

発表によると、スクリーニング担当者は見慣れない配列が未発見の自然生物に属していると考えることができなくなるため、AIが設計した新しい配列は従来のDNA合成スクリーニングを回避できるという。これとは別に、合成 3D 構造のラベルが間違っていると、公共データベースが汚染され、下流の研究に誤解を招く危険があります。どちらの問題も根本原因は共通しています。つまり、特定の生物学的設計がどこから来たのかを現時点で証明できる人は誰もいません。

2 つの透かしアプローチ、1 つの目標

SynthID Bio は、その技術をデータの種類に適応させます。タンパク質配列の場合、配列が生成されるときにアミノ酸の選択を微妙にガイドし、検出ツールが検出できる統計シグナルを埋め込みます。予測された 3D 構造の場合、検出可能なシグネチャを運ぶ原子座標にわずかな調整が行われます。

最も強力な証拠はウェットラボ検証から得られます。研究者らは、SynthID Bio 対応バージョンの ProteinMPNN を DeepMind の AlphaProteo バインダー設計手法と併用して、VEGF-A、SARS-CoV-2 スパイクタンパク質受容体結合ドメイン、PD-L1 の 3 つのタンパク質をターゲットとした設計に透かしを入れました。透かしを入れたデザインは、ヒット率、KD として測定した結合親和性、および天然の配列多様性に関して、透かしを入れていない対応物と一致しました。言い換えれば、ウォーターマークは分子の役割を果たす能力を低下させなかったということです。

タンパク質のフォールディングに関して、DeepMind は別のルートを採用しました。チームは、透かし機能がモデルの重みに直接組み込まれるように、AlphaFold 3 の拡散ネットワークの一部を微調整しました。つまり、誰がモデルを実行したかに関係なく、予測されるすべての構造には検出可能なシグネチャが含まれています。一方、同社は、このアプローチが AlphaFold 3 の予測精度を維持し、ほぼ完璧な検出可能性を提供し、デジタル ノイズやわずかな座標の変化にも耐えられると報告しています。

バイオセキュリティの「スイスチーズ」防御における新たな層

DeepMind は、SynthID Bio を多層バイオセキュリティ モデルの 1 つの層として構成しています。これは、複数の独立した保護手段がそれぞれ他の安全対策の盲点をカバーする「スイス チーズ」アプローチです。 DNA 合成スクリーニングは最前線にあります。デジタルタンパク質設計を物理的な分子に変換するには、既知の脅威のデータベースに対してリクエストをスクリーニングする合成プロバイダーに DNA を注文する必要があります。現在、馴染みのない注文を検証するには、徹底的な手作業によるレビューが必要となる可能性があり、正当な研究が妨げられる可能性があります。埋め込まれたウォーターマークは、注文が安全装置が組み込まれた信頼できるモデルからのものであることをプロバイダーに自動的に知らせます。

DeepMindが引用した独立専門家らもその枠組みに同調した。 「SynthID Bioは、生物学的設計の出所を追跡するためのパズルの重要なピースです」とバイオセキュリティ政策の専門家でサイエンス・ポリシー・コンサルティングのプリンシパルであるサラ・カーター氏は述べ、透かしにより開発者は安全性をリードでき、合成プロバイダーはスクリーニングを合理化できると付け加えた。この論文について初期のフィードバックを提供したTwist Bioscience社の政策およびバイオセキュリティ担当副社長であるJames Diggans氏は、透かしは「バイオセキュリティツールボックスへの有望な新たな追加」であり、より厳密な検討が必要な配列に精査を集中できる可能性があると述べた。

同じ出所シグナルにより、一般からの投稿を受け入れる Protein Data Bank、UniProt、GenBank などのオープンな科学リポジトリを保護できる可能性があります。 AI によって生成された生物学が蓄積されるにつれて、SynthID Bio は、他の研究者やバイオセキュリティの決定が依存する記録が汚染される前に、合成エントリにフラグを立てたり検証したりできる可能性があります。

限界と次に起こること

DeepMind は、システムが改ざん防止されていないことを率直に述べています。意図的な敵対的削除に対して透かしを堅牢にすることは、重要な未解決の課題として挙げられており、同社は、SynthID Bio を、デジタル メディアに使用されるコンテンツ認証スキームである C2PA に似た来歴メタデータ標準、または AI によって生成された生物学的データの中央リポジトリと組み合わせることを提案しています。

対象はタンパク質以外にも拡大しています。スタンフォード大学の Hie 研究室および Arc Institute との継続的な研究において、DeepMind は SynthID Bio を高度なゲノム モデルである Evo 2 に統合し、それを使用して Evo 2 で設計されたバクテリオファージのゲノムに透かしを入れました。細菌培養物での初期の実験室試験では、透かし入りファージが機能し続けていることが確認されており、同社は技術原稿が近々出版される予定であると述べている。

AI が自然界には存在しなかった生物学的コードを書き始めている分野では、「誰がどのモデルを使ってこれを作ったのか」に答えることができるようになります。静かにインフラになりつつあります。 SynthID Bio は、その方向への初期の意図的に慎重な一歩です。その作成者は、残りのバイオセキュリティ スタックの代替ではなく、補完であると主張しています。 AI 研究がどのように進化しているかについて詳しくは、各研究室が生成モデルを自然科学の奥深くまで推し進めている最新の AI 開発をフォローしてください。

AI の先を行く

全文などは当社のホームページでご覧ください: AI ニュースをもっと読む→