Google DeepMind wprowadził SynthID Bio, nową rodzinę metod znakowania wodnego, które osadzają wykrywalny, niezauważalny podpis bezpośrednio w białkach zaprojektowanych przez sztuczną inteligencję. Zapowiedziany 30 września system rozszerza firmową technologię znakowania wodnego SynthID — stosowaną już do oznaczania tekstu, obrazów, plików audio i wideo generowanych przez sztuczną inteligencję — na biologię syntetyczną, gdzie stawką jest bezpieczeństwo biologiczne i integralność publicznych naukowych baz danych.
W przeciwieństwie do cyfrowego znaku wodnego, biologiczny znak wodny musi przetrwać znacznie trudniejszy test: musi pozostać wykrywalny nie tylko w wynikach modelu programowego, ale także w samym zsyntetyzowanym, fizycznym białku. Według DeepMind SynthID Bio przekracza tę poprzeczkę. W eksperymentach laboratoryjnych projekty białek ze znakiem wodnym zachowały swoją funkcję biologiczną, a jednocześnie były możliwe do zweryfikowania, tworząc coś, co firma opisuje jako pierwsze w historii biologicznie funkcjonalne spoiwa białkowe ze znakiem wodnym. Prace opisano szczegółowo w artykule Nature zatytułowanym „Zachowujący funkcję znak wodny białek generowanych przez sztuczną inteligencję”. Więcej kontekstu na ten temat znajdziesz w naszych trendy AI.
Dlaczego biologia znaku wodnego?
Generatywna sztuczna inteligencja stała się prawdziwym narzędziem badań biologicznych. DeepMind wskazuje na własne portfolio: AlphaFold do przewidywania struktur białek, AlphaProteo i ProteinMPNN do projektowania zupełnie nowych białek, a ostatnio systemy AI wykorzystywane do opracowywania nowych bakteriofagów – wirusów infekujących bakterie. Te same narzędzia stwarzają jednak nowe zagrożenia.
Zgodnie z zapowiedzią nowe sekwencje zaprojektowane przez sztuczną inteligencję mogą ominąć tradycyjne badania przesiewowe syntezy DNA, ponieważ osoby przeprowadzające badania przesiewowe nie mogą już zakładać, że nieznana sekwencja należy do jakiegoś nieodkrytego organizmu naturalnego. Co więcej, błędnie oznakowane syntetyczne struktury 3D stwarzają ryzyko zanieczyszczenia publicznych baz danych i wprowadzenia w błąd w dalszych badaniach. Obydwa problemy mają wspólną przyczynę: nikt nie jest obecnie w stanie udowodnić, skąd wziął się dany projekt biologiczny.
Dwa podejścia do znakowania wodnego, jeden cel
SynthID Bio dostosowuje swoją technikę do rodzaju danych. W przypadku sekwencji białkowych w subtelny sposób kieruje wyborem aminokwasów w trakcie generowania sekwencji, osadzając sygnał statystyczny, który mogą wychwycić narzędzia do wykrywania. W przypadku przewidywanych struktur 3D wprowadza niewielkie korekty współrzędnych atomowych, które noszą wykrywalny podpis.
Najsilniejsze dowody pochodzą z walidacji w mokrym laboratorium. Pracując z wersją ProteinMPNN z obsługą SynthID Bio oraz metodą projektowania spoiwa AlphaProteo firmy DeepMind, badacze oznaczyli znakami wodnymi projekty ukierunkowane na trzy białka: VEGF-A, domenę wiążącą receptor białka kolczastego SARS-CoV-2 i PD-L1. Projekty ze znakiem wodnym odpowiadały swoim odpowiednikom bez znaku wodnego pod względem współczynnika trafień, powinowactwa wiązania mierzonego jako KD i naturalnej różnorodności sekwencji. Innymi słowy, znak wodny nie pogorszył zdolności cząsteczek do wykonywania swojej pracy.
W przypadku zwijania białek DeepMind wybrał inną drogę: zespół dopracował część sieci dyfuzyjnej AlphaFold 3, tak aby zdolność znakowania wodnego była wbudowana bezpośrednio w ciężar modelu. Oznacza to, że każda przewidywana struktura niesie wykrywalną sygnaturę niezależnie od tego, kto obsługuje model, a firma twierdzi, że to podejście pozwala zachować dokładność przewidywań AlphaFold 3, zapewnia niemal idealną wykrywalność i wytrzymuje szum cyfrowy lub drobne zmiany współrzędnych.
Nowa warstwa ochrony biologicznej w postaci „szwajcarskiego sera”.
DeepMind postrzega SynthID Bio jako jedną warstwę warstwowego modelu bezpieczeństwa biologicznego — podejścia „szwajcarskiego sera”, w którym wiele niezależnych zabezpieczeń zakrywa martwe punkty pozostałych. Na pierwszej linii frontu znajdują się badania przesiewowe syntezy DNA: przekształcenie cyfrowego projektu białka w cząsteczkę fizyczną wymaga zamówienia DNA od dostawców syntezy, którzy sprawdzają żądania pod kątem baz danych znanych zagrożeń. Weryfikacja nieznanego zamówienia dzisiaj może wymagać wyczerpującej ręcznej weryfikacji, która blokuje uzasadnione badania. Wbudowany znak wodny daje dostawcom automatyczny sygnał, że zamówienie pochodzi od zaufanego modelu z wbudowanymi zabezpieczeniami.
Niezależni eksperci cytowani przez DeepMind powtórzyli to sformułowanie. „SynthID Bio to ważny element układanki umożliwiający śledzenie pochodzenia projektów biologicznych” – powiedziała Sarah Carter, ekspert ds. polityki bezpieczeństwa biologicznego i dyrektor w Science Policy Consulting, dodając, że znaki wodne pozwalają programistom kierować w zakresie bezpieczeństwa, a dostawcom syntez usprawniać badania przesiewowe. James Diggans, wiceprezes ds. polityki i bezpieczeństwa biologicznego w Twist Bioscience, który przekazał wstępne opinie na temat artykułu, nazwał znak wodny „obiecującym nowym dodatkiem do zestawu narzędzi bezpieczeństwa biologicznego”, który mógłby skupić się na sekwencjach wymagających dokładniejszej analizy.
Ten sam sygnał pochodzenia mógłby chronić otwarte repozytoria naukowe, takie jak Protein Data Bank, UniProt i GenBank, które przyjmują zgłoszenia publiczne. W miarę gromadzenia się biologii generowanej przez sztuczną inteligencję SynthID Bio może oznaczać lub weryfikować syntetyczne wpisy, zanim zanieczyszczą one dokumentację, na której opierają się inni badacze i decyzje dotyczące bezpieczeństwa biologicznego.
Limity i co dalej
DeepMind szczerze przyznaje, że system nie jest odporny na manipulacje. Zapewnienie odporności znaku wodnego na celowe usunięcie przez adwersarzy jest wymieniane jako kluczowe otwarte wyzwanie, a firma sugeruje połączenie SynthID Bio ze standardami metadanych pochodzenia podobnymi do C2PA, czyli schematem uwierzytelniania treści stosowanym w mediach cyfrowych, lub z centralnymi repozytoriami danych biologicznych generowanych przez sztuczną inteligencję.
Zakres wykracza także poza białka. W ramach ciągłej pracy z laboratorium Hie na Uniwersytecie Stanforda i Instytutem Arc firma DeepMind zintegrowała SynthID Bio z zaawansowanym modelem genomu Evo 2 i użyła go do znaku wodnego genomu bakteriofaga zaprojektowanego w Evo 2. Wczesne badania laboratoryjne w kulturach bakteryjnych potwierdziły, że fagi ze znakiem wodnym pozostają funkcjonalne, a firma twierdzi, że wkrótce ukaże się manuskrypt techniczny.
Dla dziedziny, w której sztuczna inteligencja zaczyna pisać kod biologiczny, który nigdy nie istniał w naturze, będąc w stanie odpowiedzieć „kto to stworzył i za pomocą jakiego modelu?” po cichu staje się infrastrukturą. SynthID Bio to wczesny, celowo ostrożny krok w tym kierunku — taki, który według jego twórców stanowi uzupełnienie, a nie substytut reszty pakietu bezpieczeństwa biologicznego. Aby uzyskać więcej informacji na temat ewolucji badań nad sztuczną inteligencją, śledź najnowsze osiągnięcia w dziedzinie sztucznej inteligencji, ponieważ laboratoria stale wpychają modele generatywne w głąb nauk przyrodniczych.
Wyprzedź sztuczną inteligencję
Śledź całą historię i nie tylko na naszej stronie głównej: Przeczytaj więcej aktualności AI →
