Google DeepMind heeft SynthID Bio geïntroduceerd, een nieuwe familie van watermerkmethoden die een detecteerbare, onmerkbare handtekening rechtstreeks in AI-ontworpen eiwitten inbedden. Aangekondigd op 30 september breidt het systeem de SynthID-watermerktechnologie van het bedrijf – die al wordt gebruikt om door AI gegenereerde tekst, afbeeldingen, audio en video te labelen – uit naar synthetische biologie, waarbij de inzet onder meer bioveiligheid en de integriteit van openbare wetenschappelijke databases is.

In tegenstelling tot digitale watermerken moet een biologisch watermerk een veel zwaardere test doorstaan: het moet niet alleen detecteerbaar blijven in de output van een softwaremodel, maar ook in het gesynthetiseerde, fysieke eiwit zelf. Volgens DeepMind ruimt SynthID Bio die lat op. In laboratoriumexperimenten behielden eiwitontwerpen met een watermerk hun biologische functie terwijl ze verifieerbaar bleven, en produceerden wat het bedrijf beschrijft als de allereerste biologisch functionele eiwitbinders met een watermerk. Het werk wordt gedetailleerd beschreven in een Nature-artikel met de titel "Function-preserving watermarking of AI-generated Proteins." Voor meer context over dit verhaal, zie ons laatste AI-ontwikkelingen.

Waarom watermerkbiologie?

Generatieve AI is een echt instrument van biologisch onderzoek geworden. DeepMind verwijst naar zijn eigen portfolio: AlphaFold voor het voorspellen van eiwitstructuren, AlphaProteo en ProteinMPNN voor het ontwerpen van geheel nieuwe eiwitten, en meer recentelijk AI-systemen die worden gebruikt om nieuwe bacteriofagen te ontwikkelen – virussen die bacteriën infecteren. Dezelfde instrumenten creëren echter nieuwe risico's.

Volgens de aankondiging kunnen nieuwe, door AI ontworpen sequenties de traditionele screening van DNA-synthese omzeilen, omdat screeners niet langer kunnen aannemen dat een onbekende sequentie tot een onontdekt natuurlijk organisme behoort. Daarnaast bestaat het risico dat verkeerd gelabelde synthetische 3D-structuren openbare databases vervuilen en downstream-onderzoek misleiden. Beide problemen delen een hoofdoorzaak: niemand kan momenteel bewijzen waar een bepaald biologisch ontwerp vandaan komt.

Twee benaderingen van watermerken, één doel

SynthID Bio past zijn techniek aan aan het type data. Voor eiwitsequenties begeleidt het op subtiele wijze de keuze van aminozuren terwijl de sequentie wordt gegenereerd, waarbij een statistisch signaal wordt ingebed dat detectietools kunnen oppikken. Voor voorspelde 3D-structuren maakt het kleine aanpassingen aan atomaire coördinaten die een detecteerbare signatuur dragen.

Het sterkste bewijs komt van validatie in het natte laboratorium. Door te werken met een SynthID Bio-enabled versie van ProteinMPNN naast DeepMind's AlphaProteo binder-ontwerpmethode, hebben onderzoekers ontwerpen voorzien van een watermerk die gericht zijn op drie eiwitten: VEGF-A, het SARS-CoV-2-spike-eiwitreceptor-bindende domein en PD-L1. De ontwerpen met een watermerk kwamen overeen met hun tegenhangers zonder watermerk wat betreft hitpercentage, bindingsaffiniteit gemeten als KD en natuurlijke sequentiediversiteit. Met andere woorden: het watermerk verminderde het vermogen van de moleculen om hun werk te doen niet.

Voor het vouwen van eiwitten heeft DeepMind een andere route gevolgd: het team heeft een deel van het diffusienetwerk van AlphaFold 3 verfijnd, zodat het vermogen tot watermerken rechtstreeks in de gewichten van het model is ingebouwd. Dat betekent dat elke voorspelde structuur een detecteerbare signatuur draagt, ongeacht wie het model beheert, terwijl het bedrijf rapporteert dat de aanpak de voorspellingsnauwkeurigheid van AlphaFold 3 behoudt, een vrijwel perfecte detecteerbaarheid biedt en bestand is tegen digitale ruis of kleine coördinaatveranderingen.

Een nieuwe laag in de 'Zwitserse kaas'-verdediging van bioveiligheid

DeepMind kadert SynthID Bio als één laag in een gelaagd bioveiligheidsmodel – de ‘Zwitserse kaas’-benadering, waarbij meerdere onafhankelijke waarborgen elk de blinde vlekken van de ander bedekken. Het screenen van DNA-synthese bevindt zich in de frontlinie: het omzetten van een digitaal eiwitontwerp in een fysiek molecuul vereist het bestellen van DNA bij syntheseleveranciers, die verzoeken screenen aan de hand van databases met bekende bedreigingen. Tegenwoordig kan het verifiëren van een onbekende bestelling een uitgebreide handmatige beoordeling vereisen, waardoor legitiem onderzoek wordt geblokkeerd. Een ingebed watermerk geeft providers een geautomatiseerd signaal dat een bestelling afkomstig is van een vertrouwd model met ingebouwde beveiliging.

Onafhankelijke deskundigen, geciteerd door DeepMind, herhaalden deze formulering. "SynthID Bio is een belangrijk stukje van de puzzel voor het volgen van de herkomst van biologische ontwerpen", zegt Sarah Carter, een beleidsexpert op het gebied van bioveiligheid en directeur bij Science Policy Consulting, eraan toevoegend dat de watermerken ontwikkelaars de leiding geven op het gebied van veiligheid en syntheseaanbieders de screening laten stroomlijnen. James Diggans, vice-president Beleid en Bioveiligheid bij Twist Bioscience, die al vroeg feedback gaf op het artikel, noemde watermerken “een veelbelovende nieuwe toevoeging aan de bioveiligheidstoolbox” die het onderzoek zou kunnen richten op sequenties die nader onderzoek rechtvaardigen.

Hetzelfde herkomstsignaal zou open wetenschappelijke opslagplaatsen kunnen beschermen, zoals de Protein Data Bank, UniProt en GenBank, die openbare inzendingen accepteren. Naarmate de door AI gegenereerde biologie zich opstapelt, kan SynthID Bio synthetische inzendingen markeren of verifiëren voordat ze de gegevens besmetten waarop andere onderzoekers (en bioveiligheidsbeslissingen) vertrouwen.

Grenzen, en wat daarna komt

DeepMind is openhartig dat het systeem niet fraudebestendig is. Het robuust maken van het watermerk tegen opzettelijke verwijdering door tegenstanders wordt genoemd als een belangrijke open uitdaging, en het bedrijf stelt voor om SynthID Bio te koppelen aan metadatastandaarden voor de herkomst vergelijkbaar met C2PA, het content-credential-schema dat wordt gebruikt voor digitale media, of met centrale opslagplaatsen van door AI gegenereerde biologische gegevens.

De reikwijdte breidt zich ook uit buiten eiwitten. In lopende samenwerking met het Hie-lab van Stanford University en het Arc Institute integreerde DeepMind SynthID Bio in Evo 2, een geavanceerd genomisch model, en gebruikte het om het genoom van een door Evo 2 ontworpen bacteriofaag van een watermerk te voorzien. Vroege laboratoriumtests in bacterieculturen bevestigden dat de gewatermerkte fagen functioneel blijven, en het bedrijf zegt dat er een technisch manuscript op komst is.

Voor een vakgebied waarin AI biologische code begint te schrijven die in de natuur nooit heeft bestaan, is het mogelijk om te antwoorden "wie heeft dit gemaakt en met welk model?" wordt stilletjes infrastructuur. SynthID Bio is een vroege, bewust voorzichtige stap in die richting – een stap waarvan de makers volhouden dat deze een aanvulling is op, en geen vervanging voor, de rest van de bioveiligheidsstapel. Voor meer informatie over hoe AI-onderzoek zich ontwikkelt, volgt u de nieuwste AI-ontwikkelingen terwijl laboratoria generatieve modellen dieper in de natuurwetenschappen blijven duwen.

Blijf AI een stap voor

Volg het volledige verhaal en meer op onze homepage: Lees meer AI-nieuws →