Google DeepMind представив SynthID Bio, нове сімейство методів водяних знаків, які вбудовують помітний, непомітний підпис безпосередньо в білки, розроблені ШІ. Анонсована 30 вересня система розширює технологію водяних знаків SynthID, яка вже використовується для маркування створених ШІ текстів, зображень, аудіо та відео, на синтетичну біологію, де ставки включають біозахист і цілісність публічних наукових баз даних.
На відміну від цифрових водяних знаків, біологічний водяний знак повинен витримати набагато суворіші випробування: він повинен залишатися видимим не лише на виході програмної моделі, але й у самому синтезованому фізичному білку. Згідно з DeepMind, SynthID Bio очищає цю планку. У лабораторних експериментах протеїнові конструкції з водяними знаками зберегли свою біологічну функцію, залишаючись перевіреними, виробляючи те, що компанія описує як перші в історії біологічно функціональні зв’язувальні білки з водяними знаками. Робота детально описана в статті Nature під назвою «Функція збереження водяних знаків білків, створених ШІ». For more context on this story, see our ongoing AI news.
Чому водяний знак біології?
Generative AI став справжнім інструментом біологічних досліджень. DeepMind вказує на власне портфоліо: AlphaFold для прогнозування білкових структур, AlphaProteo та ProteinMPNN для розробки абсолютно нових білків, а нещодавно системи штучного інтелекту, які використовуються для розробки нових бактеріофагів — вірусів, які інфікують бактерії. Однак ті самі інструменти створюють нові ризики.
Згідно з оголошенням, нові послідовності, розроблені штучним інтелектом, можуть обійти традиційний скринінг синтезу ДНК, оскільки перевіряючі більше не можуть вважати, що незнайома послідовність належить якомусь невиявленому природному організму. Окремо неправильно позначені синтетичні 3D-структури ризикують забруднювати загальнодоступні бази даних і вводити в оману наступні дослідження. Обидві проблеми мають спільну першопричину: наразі ніхто не може довести, звідки взявся певний біологічний дизайн.
Два підходи водяних знаків, одна мета
SynthID Bio адаптує свою техніку до типу даних. Для білкових послідовностей він тонко керує вибором амінокислот під час генерації послідовності, вбудовуючи статистичний сигнал, який можуть вловити інструменти виявлення. Для передбачених 3D-структур він вносить невеликі коригування атомних координат, які несуть помітний підпис.
Найпереконливіші докази отримано від валідації у вологих лабораторіях. Працюючи з версією ProteinMPNN із підтримкою SynthID Bio та методом зв’язування AlphaProteo від DeepMind, дослідники поставили водяні знаки на проекти, націлені на три білки: VEGF-A, домен зв’язування рецепторів спайкового білка SARS-CoV-2 і PD-L1. Дизайни з водяними знаками збігалися зі своїми аналогами без водяних знаків за частотою попадання, афінністю зв’язування, виміряною як KD, і різноманітністю природних послідовностей. Іншими словами, водяний знак не погіршував здатність молекул виконувати свою роботу.
Для згортання білків DeepMind пішов іншим шляхом: команда точно налаштувала частину дифузійної мережі AlphaFold 3, щоб здатність водяних знаків вбудована безпосередньо у ваги моделі. Це означає, що кожна передбачена структура має ознаки, які можна виявити, незалежно від того, хто запускає модель, а компанія повідомляє, що підхід зберігає точність прогнозування AlphaFold 3, забезпечує майже ідеальну видимість і витримує цифровий шум або незначні зміни координат.
Новий рівень захисту «швейцарського сиру» біозахисту
DeepMind створює SynthID Bio як один рівень багаторівневої моделі біозахисту — підхід «швейцарського сиру», де кілька незалежних засобів захисту покривають сліпі зони інших. Скринінг синтезу ДНК знаходиться на передовій: щоб перетворити цифровий дизайн білка на фізичну молекулу, потрібно замовляти ДНК у постачальників синтезу, які перевіряють запити на відповідність базам даних відомих загроз. Перевірка незнайомого замовлення сьогодні може вимагати вичерпної перевірки вручну, що зупинить законне дослідження. Вбудований водяний знак дає постачальникам автоматичний сигнал про те, що замовлення походить від надійної моделі з вбудованими засобами захисту.
Незалежні експерти, яких цитує DeepMind, повторили цю думку. «SynthID Bio — це важлива частина головоломки для відстеження походження біологічних конструкцій», — сказала Сара Картер, експерт із політики біозахисту та директор Science Policy Consulting, додавши, що водяні знаки дозволяють розробникам керувати безпекою, а постачальникам синтезу — оптимізувати скринінг. Джеймс Дігганс, віце-президент із питань політики та біозахисту компанії Twist Bioscience, який надав попередні відгуки про статтю, назвав водяні знаки «новим багатообіцяючим доповненням до набору інструментів біозахисту», яке може зосередити увагу на послідовностях, які вимагають більш ретельного вивчення.
Той самий сигнал про походження може захистити відкриті наукові сховища, такі як Protein Data Bank, UniProt і GenBank, які приймають публічні матеріали. Оскільки біологія, створена ШІ, накопичується, SynthID Bio може позначати або перевіряти синтетичні записи, перш ніж вони забруднить записи, на які покладаються інші дослідники — і рішення щодо біозахисту.
Обмеження та що буде далі
DeepMind відверто каже, що система не захищена від втручання. Зробити водяний знак надійним проти навмисного зловмисного видалення вказано як ключову відкриту проблему, і компанія пропонує поєднати SynthID Bio зі стандартами метаданих про походження, подібними до C2PA, схемою облікових даних вмісту, яка використовується для цифрових медіа, або з центральними сховищами біологічних даних, створених ШІ.
Сфера застосування також розширюється за межі білків. У поточній роботі з лабораторією Hie у Стенфордському університеті та Arc Institute DeepMind інтегрував SynthID Bio в Evo 2, вдосконалену геномну модель, і використав її для нанесення водяного знака на геном бактеріофага, розробленого Evo 2. Ранні лабораторні тести на бактеріальних культурах підтвердили, що фаги з водяним знаком залишаються функціональними, і компанія каже, що технічний рукопис очікується.
Для галузі, де штучний інтелект починає писати біологічний код, якого ніколи не існувало в природі, маючи можливість відповісти на запитання «хто це створив і за допомогою якої моделі?» тихо стає інфраструктурою. SynthID Bio — це ранній, навмисно обережний крок у цьому напрямку — той, на якому його творці наполягають, є доповненням, а не заміною решти стека біозахисту. Щоб дізнатися більше про те, як розвиваються дослідження штучного інтелекту, слідкуйте за останніми розробками ШІ, оскільки лабораторії продовжують просувати генеративні моделі все глибше в природничі науки.
Будьте попереду ШІ
Слідкуйте за повною новиною та іншими новинами на нашій домашній сторінці: Читати більше новин AI →
