Google DeepMind hat SynthID Bio eingeführt, eine neue Familie von Wasserzeichenmethoden, die eine erkennbare, nicht wahrnehmbare Signatur direkt in von KI entworfene Proteine ​​einbetten. Das am 30. September angekündigte System erweitert die SynthID-Wasserzeichentechnologie des Unternehmens – die bereits zur Kennzeichnung von KI-generiertem Text, Bildern, Audio und Video verwendet wird – auf die synthetische Biologie, wo es um Biosicherheit und die Integrität öffentlicher wissenschaftlicher Datenbanken geht.

Im Gegensatz zum digitalen Wasserzeichen muss ein biologisches Wasserzeichen einen viel härteren Test bestehen: Es muss nicht nur in der Ausgabe eines Softwaremodells, sondern auch im synthetisierten, physischen Protein selbst erkennbar bleiben. Laut DeepMind löscht SynthID Bio diese Messlatte. In Laborexperimenten behielten mit Wasserzeichen versehene Proteindesigns ihre biologische Funktion bei und blieben gleichzeitig überprüfbar. So entstanden die ersten mit Wasserzeichen versehenen und biologisch funktionellen Proteinbinder, wie das Unternehmen beschreibt. Die Arbeit wird in einem Nature-Artikel mit dem Titel „Function-preserving Watermarking of AI-generated Proteins“ detailliert beschrieben. Weitere Informationen zu dieser Geschichte finden Sie in unserer KI-Nachrichten.

Warum Wasserzeichenbiologie?

Generative KI ist zu einem echten Werkzeug der biologischen Forschung geworden. DeepMind verweist auf sein eigenes Portfolio: AlphaFold zur Vorhersage von Proteinstrukturen, AlphaProteo und ProteinMPNN zur Entwicklung völlig neuer Proteine ​​und in jüngerer Zeit KI-Systeme zur Entwicklung neuer Bakteriophagen – Viren, die Bakterien infizieren. Die gleichen Werkzeuge schaffen jedoch neue Risiken.

Der Ankündigung zufolge können neuartige, von KI entworfene Sequenzen das herkömmliche DNA-Synthese-Screening umgehen, da Screener nicht mehr davon ausgehen können, dass eine unbekannte Sequenz zu einem unentdeckten natürlichen Organismus gehört. Darüber hinaus besteht die Gefahr, dass falsch beschriftete synthetische 3D-Strukturen öffentliche Datenbanken verunreinigen und nachgelagerte Forschung in die Irre führen. Beide Probleme haben eine gemeinsame Ursache: Niemand kann derzeit nachweisen, woher ein bestimmtes biologisches Design stammt.

Zwei Wasserzeichenansätze, ein Ziel

SynthID Bio passt seine Technik an die Art der Daten an. Bei Proteinsequenzen steuert es auf subtile Weise die Auswahl der Aminosäuren, während die Sequenz generiert wird, und bettet ein statistisches Signal ein, das Erkennungstools erfassen können. Bei vorhergesagten 3D-Strukturen werden kleine Anpassungen an Atomkoordinaten vorgenommen, die eine erkennbare Signatur tragen.

Der stärkste Beweis stammt aus der Nasslaborvalidierung. Mithilfe einer SynthID Bio-aktivierten Version von ProteinMPNN und der Binder-Design-Methode AlphaProteo von DeepMind haben Forscher Designs mit Wasserzeichen versehen, die auf drei Proteine ​​abzielen: VEGF-A, die SARS-CoV-2-Spike-Protein-Rezeptor-Bindungsdomäne und PD-L1. Die mit Wasserzeichen versehenen Designs stimmten hinsichtlich der Trefferquote, der als KD gemessenen Bindungsaffinität und der natürlichen Sequenzvielfalt mit ihren Gegenstücken ohne Wasserzeichen überein. Mit anderen Worten: Das Wasserzeichen beeinträchtigte nicht die Fähigkeit der Moleküle, ihre Aufgabe zu erfüllen.

Bei der Proteinfaltung ging DeepMind einen anderen Weg: Das Team optimierte einen Teil des Diffusionsnetzwerks von AlphaFold 3 so, dass die Fähigkeit zur Wasserzeichenmarkierung direkt in die Gewichte des Modells integriert ist. Das bedeutet, dass jede vorhergesagte Struktur eine erkennbare Signatur trägt, unabhängig davon, wer das Modell betreibt, während das Unternehmen berichtet, dass der Ansatz die Vorhersagegenauigkeit von AlphaFold 3 beibehält, eine nahezu perfekte Erkennbarkeit bietet und digitalem Rauschen oder geringfügigen Koordinatenänderungen standhält.

Eine neue Ebene in der „Schweizer Käse“-Verteidigung der Biosicherheit

DeepMind stellt SynthID Bio als eine Schicht in einem mehrschichtigen Biosicherheitsmodell dar – dem „Schweizer Käse“-Ansatz, bei dem mehrere unabhängige Schutzmaßnahmen jeweils die blinden Flecken der anderen abdecken. Das DNA-Synthese-Screening steht an vorderster Front: Um ein digitales Proteindesign in ein physisches Molekül umzuwandeln, muss DNA bei Syntheseanbietern bestellt werden, die Anfragen anhand von Datenbanken bekannter Bedrohungen prüfen. Die Überprüfung einer unbekannten Bestellung kann heute eine umfassende manuelle Überprüfung erfordern, die legitime Recherchen behindert. Ein eingebettetes Wasserzeichen gibt Anbietern ein automatisiertes Signal, dass eine Bestellung von einem vertrauenswürdigen Modell mit integrierten Sicherheitsmaßnahmen stammt.

Von DeepMind zitierte unabhängige Experten bestätigten diese Auffassung. „SynthID Bio ist ein wichtiger Teil des Puzzles, um die Herkunft biologischer Designs zu verfolgen“, sagte Sarah Carter, Expertin für Biosicherheitspolitik und Leiterin bei Science Policy Consulting, und fügte hinzu, dass die Wasserzeichen den Entwicklern eine Führungsrolle bei der Sicherheit geben und es Syntheseanbietern ermöglichen, das Screening zu optimieren. James Diggans, Vizepräsident für Politik und Biosicherheit bei Twist Bioscience, der frühes Feedback zu dem Papier gab, nannte Wasserzeichen „eine vielversprechende neue Ergänzung der Biosicherheits-Toolbox“, die die Untersuchung auf Sequenzen konzentrieren könnte, die eine genauere Überprüfung erfordern.

Das gleiche Herkunftssignal könnte offene wissenschaftliche Repositorien wie die Protein Data Bank, UniProt und GenBank schützen, die öffentliche Einreichungen akzeptieren. Während sich KI-generierte Biologie ansammelt, könnte SynthID Bio synthetische Einträge kennzeichnen oder überprüfen, bevor sie die Aufzeichnungen kontaminieren, auf die sich andere Forscher – und Biosicherheitsentscheidungen – verlassen.

Grenzen und was als nächstes kommt

DeepMind gibt offen zu, dass das System nicht manipulationssicher ist. Die Robustheit des Wasserzeichens gegen die absichtliche Entfernung durch Angreifer wird als eine der wichtigsten offenen Herausforderungen aufgeführt, und das Unternehmen schlägt vor, SynthID Bio mit Herkunftsmetadatenstandards ähnlich C2PA, dem für digitale Medien verwendeten Content-Credential-Schema, oder mit zentralen Repositories für KI-generierte biologische Daten zu kombinieren.

Der Anwendungsbereich erweitert sich auch über Proteine ​​hinaus. In laufender Zusammenarbeit mit dem Hie-Labor der Stanford University und dem Arc Institute integrierte DeepMind SynthID Bio in Evo 2, ein fortschrittliches Genommodell, und nutzte es, um das Genom eines von Evo 2 entworfenen Bakteriophagen mit einem Wasserzeichen zu versehen. Erste Labortests in Bakterienkulturen bestätigten, dass die mit Wasserzeichen versehenen Phagen weiterhin funktionsfähig bleiben, und das Unternehmen gibt an, dass ein technisches Manuskript in Vorbereitung sei.

Für einen Bereich, in dem KI beginnt, biologischen Code zu schreiben, der in der Natur noch nie existiert hat, ist die Frage „Wer hat das gemacht und mit welchem ​​Modell?“ möglich. wird still und leise zur Infrastruktur. SynthID Bio ist ein früher, bewusst vorsichtiger Schritt in diese Richtung – einer, von dem seine Entwickler behaupten, dass er den Rest des Biosicherheits-Stacks ergänzt und nicht ersetzt. Um mehr darüber zu erfahren, wie sich die KI-Forschung weiterentwickelt, verfolgen Sie die neuesten KI-Entwicklungen, während Labore generative Modelle immer tiefer in die Naturwissenschaften drängen.

Der KI einen Schritt voraus sein

Verfolgen Sie die ganze Geschichte und mehr auf unserer Homepage: Weitere KI-Neuigkeiten lesen →