Google DeepMind представила SynthID Bio, новое семейство методов нанесения водяных знаков, которые встраивают обнаруживаемую, незаметную подпись непосредственно в белки, разработанные ИИ. Анонсированная 30 сентября, система расширяет технологию водяных знаков SynthID компании, которая уже используется для маркировки текста, изображений, аудио и видео, сгенерированных искусственным интеллектом, в синтетическую биологию, где ставки включают биобезопасность и целостность общедоступных научных баз данных.
В отличие от цифровых водяных знаков, биологический водяной знак должен выдержать гораздо более суровое испытание: он должен оставаться обнаруживаемым не только в результатах программной модели, но и в самом синтезированном физическом белке. По данным DeepMind, SynthID Bio преодолевает эту планку. В лабораторных экспериментах белковые конструкции с водяными знаками сохраняли свои биологические функции, оставаясь при этом проверяемыми, создавая то, что компания называет первыми в мире биологически функциональными белковыми связующими с водяными знаками. Работа подробно описана в статье Nature под названием «Сохраняющие функции водяные знаки белков, созданных ИИ». Подробнее об этой истории — в нашем новости об ИИ.
Почему биология водяных знаков?
Генеративный ИИ стал настоящим инструментом биологических исследований. DeepMind указывает на свое собственное портфолио: AlphaFold для прогнозирования белковых структур, AlphaProteo и ProteinMPNN для разработки совершенно новых белков, а в последнее время системы искусственного интеллекта, используемые для разработки новых бактериофагов — вирусов, поражающих бактерии. Однако те же инструменты создают новые риски.
Согласно объявлению, новые последовательности, разработанные ИИ, могут обойти традиционный скрининг синтеза ДНК, поскольку специалисты по скринингу больше не могут предполагать, что незнакомая последовательность принадлежит какому-то неоткрытому природному организму. Кроме того, неправильно маркированные синтетические 3D-структуры рискуют загрязнить общедоступные базы данных и ввести в заблуждение дальнейшие исследования. Обе проблемы имеют общую причину: в настоящее время никто не может доказать, откуда взялся тот или иной биологический дизайн.
Два подхода к созданию водяных знаков, одна цель
SynthID Bio адаптирует свою технику к типу данных. В случае белковых последовательностей он тонко управляет выбором аминокислот по мере создания последовательности, внедряя статистический сигнал, который могут уловить инструменты обнаружения. Для предсказанных трехмерных структур он вносит небольшие корректировки в координаты атомов, которые несут обнаруживаемую сигнатуру.
Самые убедительные доказательства получены в результате проверки в мокрой лаборатории. Работая с версией ProteinMPNN с поддержкой SynthID Bio вместе с методом создания связующего агента AlphaProteo компании DeepMind, исследователи пометили конструкции, нацеленные на три белка: VEGF-A, домен, связывающий рецептор белка шипа SARS-CoV-2, и PD-L1. Дизайны с водяными знаками соответствовали своим аналогам без водяных знаков по частоте попаданий, аффинности связывания, измеряемой как KD, и природному разнообразию последовательностей. Другими словами, водяной знак не ухудшил способность молекул выполнять свою работу.
Для сворачивания белка компания DeepMind пошла по другому пути: команда точно настроила часть диффузионной сети AlphaFold 3 так, чтобы возможность нанесения водяных знаков была встроена непосредственно в вес модели. Это означает, что каждая прогнозируемая структура имеет обнаруживаемую сигнатуру независимо от того, кто запускает модель, в то время как компания сообщает, что этот подход сохраняет точность прогнозирования AlphaFold 3, обеспечивает почти идеальную обнаруживаемость и устойчив к цифровому шуму или незначительным изменениям координат.
Новый уровень защиты «швейцарского сыра» биобезопасности
DeepMind представляет SynthID Bio как один из уровней многоуровневой модели биобезопасности — подхода «швейцарского сыра», где множество независимых средств защиты закрывают «слепые зоны» других. Проверка синтеза ДНК находится на переднем крае: для превращения цифрового дизайна белка в физическую молекулу необходимо заказывать ДНК у поставщиков синтеза, которые сопоставляют запросы с базами данных известных угроз. Проверка незнакомого заказа сегодня может потребовать тщательной ручной проверки, которая останавливает законные исследования. Встроенный водяной знак дает поставщикам автоматический сигнал о том, что заказ поступил из надежной модели со встроенными средствами защиты.
Независимые эксперты, которых цитирует DeepMind, поддержали эту формулировку. «SynthID Bio — это важная часть головоломки для отслеживания происхождения биологических образцов», — сказала Сара Картер, эксперт по политике биобезопасности и директор Science Policy Consulting, добавив, что водяные знаки позволяют разработчикам лидировать в вопросах безопасности, а поставщикам синтезов — оптимизировать проверку. Джеймс Дигганс, вице-президент по политике и биобезопасности компании Twist Bioscience, который предоставил раннюю обратную связь по документу, назвал водяные знаки «многообещающим новым дополнением к набору инструментов биобезопасности», которое могло бы сосредоточить внимание на последовательностях, требующих более тщательного изучения.
Тот же сигнал о происхождении может защитить открытые научные репозитории, такие как Protein Data Bank, UniProt и GenBank, которые принимают публичные материалы. По мере накопления биологических данных, созданных ИИ, SynthID Bio может отмечать или проверять синтетические записи, прежде чем они загрязнят записи, на которые полагаются другие исследователи и решения по биобезопасности.
Ограничения и что будет дальше
DeepMind откровенно заявляет, что система не защищена от несанкционированного доступа. Обеспечение устойчивости водяного знака к преднамеренному состязательному удалению считается ключевой открытой задачей, и компания предлагает объединить SynthID Bio со стандартами метаданных происхождения, аналогичными C2PA, схемой аутентификации контента, используемой для цифровых носителей, или с центральными хранилищами биологических данных, сгенерированных ИИ.
Область применения также выходит за рамки белков. В ходе продолжающейся работы с лабораторией Хи в Стэнфордском университете и Институтом Арк компания DeepMind интегрировала SynthID Bio в Evo 2, усовершенствованную геномную модель, и использовала ее для нанесения водяного знака на геном бактериофага, разработанного Evo 2. Ранние лабораторные испытания в бактериальных культурах подтвердили, что фаги с водяными знаками остаются функциональными, и компания сообщает, что скоро появится техническая рукопись.
Для области, где ИИ начинает писать биологический код, никогда не существовавший в природе, имея возможность ответить: «Кто это сделал и с помощью какой модели?» постепенно становится инфраструктурой. SynthID Bio — это ранний, сознательно осторожный шаг в этом направлении, который, как настаивают его создатели, является дополнением, а не заменой остальной части комплекса биобезопасности. Чтобы узнать больше о том, как развиваются исследования в области ИИ, следите за последними разработками в области ИИ, поскольку лаборатории продолжают внедрять генеративные модели в естественные науки.
Будьте впереди ИИ
Следите за полной историей и другими новостями на нашей домашней странице: Читать больше новостей AI →
