Google DeepMind představil SynthID Bio, novou rodinu metod vodoznaku, které vkládají detekovatelný, nepostřehnutelný podpis přímo do proteinů navržených AI. Systém, který byl oznámen 30. září, rozšiřuje firemní technologii vodoznaků SynthID – již používanou k označování textu, obrázků, zvuku a videa generovaného umělou inteligencí – do syntetické biologie, kde jde o biologickou bezpečnost a integritu veřejných vědeckých databází.
Na rozdíl od digitálního vodoznaku musí biologický vodoznak přežít mnohem tvrdší test: musí zůstat detekovatelný nejen ve výstupu softwarového modelu, ale i v samotném syntetizovaném fyzickém proteinu. Podle DeepMind SynthID Bio tuto laťku smazává. V laboratorních experimentech si designy proteinů s vodoznakem zachovaly svou biologickou funkci, přičemž zůstaly ověřitelné, a vytvořily to, co společnost popisuje jako vůbec první a biologicky funkční pojiva proteinů s vodoznakem. Práce je podrobně popsána v dokumentu Nature s názvem "Function-preserving watermarking of AI-generated proteins." For more context on this story, see our ongoing AI news.
Proč biologie vodoznaku?
Generativní umělá inteligence se stala skutečným nástrojem biologického výzkumu. DeepMind poukazuje na své vlastní portfolio: AlphaFold pro předpovídání proteinových struktur, AlphaProteo a ProteinMPNN pro navrhování zcela nových proteinů a v poslední době systémy AI používané k vývoji nových bakteriofágů – virů, které infikují bakterie. Stejné nástroje však vytvářejí nová rizika.
Podle oznámení mohou nové sekvence navržené AI obejít tradiční screening syntézy DNA, protože screeningové již nemohou předpokládat, že neznámá sekvence patří nějakému neobjevenému přirozenému organismu. Samostatně, špatně označené syntetické 3D struktury riskují znečištění veřejných databází a zavádějící následný výzkum. Oba problémy sdílejí základní příčinu: nikdo v současnosti nemůže prokázat, odkud daný biologický design pochází.
Dva přístupy k vodoznaku, jeden cíl
SynthID Bio přizpůsobuje svou techniku typu dat. U proteinových sekvencí jemně řídí výběr aminokyselin při vytváření sekvence a vkládá statistický signál, který mohou detekční nástroje zachytit. U predikovaných 3D struktur provádí malé úpravy atomových souřadnic, které nesou detekovatelný podpis.
Nejsilnější důkazy pocházejí z validace v mokré laboratoři. Ve spolupráci s verzí ProteinMPNN s podporou SynthID Bio spolu s metodou návrhu pojiva AlphaProteo společnosti DeepMind vytvořili výzkumníci návrhy vodoznaků zaměřené na tři proteiny: VEGF-A, doménu vázající receptor pro spike protein SARS-CoV-2 a PD-L1. Vzory s vodoznakem se shodovaly se svými protějšky bez vodoznaku, pokud jde o míru zásahu, vazebnou afinitu měřenou jako KD a diverzitu přirozené sekvence. Jinými slovy, vodoznak nesnižoval schopnost molekul vykonávat svou práci.
Pro skládání proteinů se DeepMind vydal jinou cestou: tým doladil část difúzní sítě AlphaFold 3 tak, aby schopnost vodoznaku byla zabudována přímo do závaží modelu. To znamená, že každá předpokládaná struktura nese detekovatelný podpis bez ohledu na to, kdo model provozuje, zatímco společnost hlásí, že tento přístup zachovává přesnost předpovědi AlphaFold 3, nabízí téměř dokonalou detekovatelnost a odolává digitálnímu šumu nebo menším změnám souřadnic.
Nová vrstva v ochraně biologické bezpečnosti proti „švýcarskému sýru“.
DeepMind vytváří SynthID Bio jako jednu vrstvu ve vrstveném modelu biologické bezpečnosti – přístupu „švýcarského sýra“, kde několik nezávislých ochranných prvků pokrývá slepá místa ostatních. Screening syntézy DNA stojí v první linii: přeměna návrhu digitálního proteinu na fyzickou molekulu vyžaduje objednání DNA od poskytovatelů syntézy, kteří prověřují požadavky na databáze známých hrozeb. Ověření neznámé objednávky dnes může vyžadovat vyčerpávající ruční kontrolu, která zastaví legitimní výzkum. Vložený vodoznak poskytuje poskytovatelům automatický signál, že objednávka pochází z důvěryhodného modelu s vestavěnými ochrannými prvky.
Nezávislí odborníci citovaní DeepMind toto rámování zopakovali. "SynthID Bio je důležitým kouskem skládačky pro sledování původu biologických vzorů," řekla Sarah Carter, expertka na politiku biologické bezpečnosti a ředitelka Science Policy Consulting, a dodala, že vodoznaky umožňují vývojářům vést v oblasti bezpečnosti a umožňují poskytovatelům syntéz zefektivnit screening. James Diggans, viceprezident pro politiku a biologickou bezpečnost ve společnosti Twist Bioscience, která poskytla první zpětnou vazbu k článku, nazval vodoznaky „slibným novým přírůstkem do sady nástrojů biologické bezpečnosti“, který by se mohl zaměřit na sledování sekvencí, které si zasluhují bližší přezkoumání.
Stejný signál původu by mohl chránit otevřená vědecká úložiště, jako jsou Protein Data Bank, UniProt a GenBank, které přijímají veřejné příspěvky. Jak se biologie generovaná umělou inteligencí hromadí, SynthID Bio může označit nebo ověřit syntetické záznamy dříve, než kontaminují záznamy, na které spoléhají ostatní výzkumníci – a rozhodnutí o biologické bezpečnosti –.
Limity a co bude dál
DeepMind je upřímný, že systém není odolný proti neoprávněné manipulaci. Zajištění odolnosti vodoznaku proti záměrnému odstranění protivníků je uvedeno jako klíčová otevřená výzva a společnost navrhuje spárovat SynthID Bio se standardy metadat původu podobnými C2PA, což je schéma obsahu a pověření používané pro digitální média, nebo s centrálními úložištěmi biologických dat generovaných AI.
Oblast působnosti se také rozšiřuje za hranice proteinů. V rámci pokračující práce s laboratoří Hie na Stanfordské univerzitě a Arc Institute integroval DeepMind SynthID Bio do Evo 2, pokročilého genomického modelu, a použil jej k vodoznaku genomu bakteriofága navrženého Evo 2. Včasné laboratorní testování na bakteriálních kulturách potvrdilo, že fágy s vodoznakem zůstávají funkční a společnost říká, že technický rukopis se připravuje.
Pro oblast, kde umělá inteligence začíná psát biologický kód, který v přírodě nikdy neexistoval, a je schopna odpovědět „kdo to vytvořil a s jakým modelem?“ se tiše stává infrastrukturou. SynthID Bio je brzkým, záměrně opatrným krokem v tomto směru – krok, o kterém jeho tvůrci trvají na tom, že je doplňkem, nikoli náhradou za zbytek balíčku biologické bezpečnosti. Chcete-li se dozvědět více o tom, jak se vyvíjí výzkum AI, sledujte nejnovější vývoj AI, protože laboratoře neustále posouvají generativní modely hlouběji do přírodních věd.
Stay Ahead of AI
Sledujte celý příběh a další na naší domovské stránce: Přečtěte si další zprávy o AI →
