Google DeepMind a introduit SynthID Bio, une nouvelle famille de méthodes de filigrane qui intègrent une signature détectable et imperceptible directement dans les protéines conçues par l'IA. Annoncé le 30 septembre, le système étend la technologie de filigrane SynthID de l'entreprise – déjà utilisée pour étiqueter le texte, les images, l'audio et la vidéo générés par l'IA – à la biologie synthétique, où les enjeux incluent la biosécurité et l'intégrité des bases de données scientifiques publiques.

Contrairement au tatouage numérique, un filigrane biologique doit survivre à un test beaucoup plus sévère : il doit rester détectable non seulement dans le résultat d'un modèle logiciel, mais dans la protéine physique synthétisée elle-même. Selon DeepMind, SynthID Bio efface cette barre. Lors d'expériences en laboratoire, les conceptions de protéines filigranées ont conservé leur fonction biologique tout en restant vérifiables, produisant ce que l'entreprise décrit comme les tout premiers liants protéiques filigranés et biologiquement fonctionnels. Le travail est détaillé dans un article de Nature intitulé « Filigrane préservant la fonction des protéines générées par l’IA ». Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.

Pourquoi filigraner la biologie ?

L’IA générative est devenue un véritable outil de recherche biologique. DeepMind souligne son propre portefeuille : AlphaFold pour prédire les structures des protéines, AlphaProteo et ProteinMPNN pour concevoir des protéines entièrement nouvelles et, plus récemment, des systèmes d'IA utilisés pour développer de nouveaux bactériophages, des virus qui infectent les bactéries. Toutefois, les mêmes outils créent de nouveaux risques.

Selon l’annonce, de nouvelles séquences conçues par l’IA peuvent contourner le criblage traditionnel par synthèse d’ADN, car les contrôleurs ne peuvent plus supposer qu’une séquence inconnue appartient à un organisme naturel non découvert. Par ailleurs, les structures 3D synthétiques mal étiquetées risquent de polluer les bases de données publiques et d’induire en erreur les recherches en aval. Les deux problèmes partagent une cause profonde : personne ne peut actuellement prouver l’origine d’une conception biologique donnée.

Deux approches de tatouage, un seul objectif

SynthID Bio adapte sa technique au type de données. Pour les séquences protéiques, il guide subtilement le choix des acides aminés au fur et à mesure de la génération de la séquence, intégrant un signal statistique que les outils de détection peuvent capter. Pour les structures 3D prédites, il apporte de petits ajustements aux coordonnées atomiques portant une signature détectable.

Les preuves les plus solides proviennent de la validation en laboratoire humide. En travaillant avec une version SynthID Bio-activée de ProteinMPNN aux côtés de la méthode de conception de liant AlphaProteo de DeepMind, les chercheurs ont filigrané des conceptions ciblant trois protéines : VEGF-A, le domaine de liaison au récepteur de la protéine de pointe du SRAS-CoV-2 et PD-L1. Les dessins filigranés correspondaient à leurs homologues non filigranés en termes de taux de réussite, d'affinité de liaison mesurée en KD et de diversité de séquence naturelle. En d’autres termes, le filigrane n’a pas dégradé la capacité des molécules à faire leur travail.

Pour le repliement des protéines, DeepMind a emprunté une voie différente : l'équipe a affiné une partie du réseau de diffusion d'AlphaFold 3 afin que la capacité de filigrane soit intégrée directement dans les poids du modèle. Cela signifie que chaque structure prédite porte une signature détectable, quelle que soit la personne qui exécute le modèle, tandis que la société rapporte que l'approche préserve la précision de prédiction d'AlphaFold 3, offre une détectabilité presque parfaite et résiste au bruit numérique ou aux changements mineurs de coordonnées.

Une nouvelle couche dans la défense du « fromage suisse » en matière de biosécurité

DeepMind considère SynthID Bio comme une couche dans un modèle de biosécurité à plusieurs niveaux – l'approche du « fromage suisse », où plusieurs protections indépendantes couvrent chacune les angles morts des autres. Le contrôle de la synthèse d'ADN est en première ligne : transformer une conception numérique de protéine en une molécule physique nécessite de commander de l'ADN auprès de fournisseurs de synthèse, qui examinent les demandes par rapport aux bases de données de menaces connues. La vérification d’une commande inconnue aujourd’hui peut nécessiter un examen manuel exhaustif qui bloque les recherches légitimes. Un filigrane intégré donne aux fournisseurs un signal automatisé indiquant qu'une commande provient d'un modèle fiable avec des garanties intégrées.

Des experts indépendants cités par DeepMind ont fait écho à ce cadrage. "SynthID Bio est une pièce importante du puzzle pour suivre la provenance des conceptions biologiques", a déclaré Sarah Carter, experte en politique de biosécurité et directrice de Science Policy Consulting, ajoutant que les filigranes permettent aux développeurs de prendre les devants en matière de sécurité et aux fournisseurs de synthèse de rationaliser le contrôle. James Diggans, vice-président des politiques et de la biosécurité chez Twist Bioscience, qui a fourni les premiers commentaires sur le document, a qualifié le filigrane de « nouvel ajout prometteur à la boîte à outils de biosécurité » qui pourrait concentrer l'examen sur les séquences qui méritent un examen plus approfondi.

Le même signal de provenance pourrait protéger les référentiels scientifiques ouverts tels que la Protein Data Bank, UniProt et GenBank, qui acceptent les soumissions publiques. À mesure que la biologie générée par l’IA s’accumule, SynthID Bio pourrait signaler ou vérifier les entrées synthétiques avant qu’elles ne contaminent les enregistrements sur lesquels s’appuient d’autres chercheurs – et les décisions en matière de biosécurité.

Limites et ce qui vient ensuite

DeepMind affirme franchement que le système n’est pas inviolable. Rendre le filigrane robuste contre la suppression délibérée d'un adversaire est répertorié comme un défi ouvert clé, et la société suggère d'associer SynthID Bio à des normes de métadonnées de provenance similaires à C2PA, le système d'identification de contenu utilisé pour les médias numériques, ou à des référentiels centraux de données biologiques générées par l'IA.

Le champ d’application s’étend également au-delà des protéines. Dans le cadre d'un travail en cours avec le laboratoire Hie de l'Université de Stanford et l'Arc Institute, DeepMind a intégré SynthID Bio dans Evo 2, un modèle génomique avancé, et l'a utilisé pour filigraner le génome d'un bactériophage conçu par Evo 2. Les premiers tests en laboratoire sur des cultures bactériennes ont confirmé que les phages filigranés restent fonctionnels, et la société annonce qu'un manuscrit technique est à venir.

Pour un domaine où l'IA commence à écrire du code biologique qui n'a jamais existé dans la nature, être capable de répondre « qui a fait ça, et avec quel modèle ? devient tranquillement une infrastructure. SynthID Bio est une première étape délibérément prudente dans cette direction – une étape qui, selon ses créateurs, est un complément et non un substitut au reste de la pile de biosécurité. Pour en savoir plus sur l’évolution de la recherche sur l’IA, suivez les derniers développements en matière d’IA alors que les laboratoires continuent d’approfondir les modèles génératifs dans les sciences naturelles.

Gardez une longueur d'avance sur l'IA

Suivez l'histoire complète et bien plus encore sur notre page d'accueil : Lire plus d'actualités sur l'IA →