谷歌 DeepMind 推出了 SynthID Bio,这是一系列新的水印方法,可将可检测的、难以察觉的签名直接嵌入人工智能设计的蛋白质中。该系统于 9 月 30 日宣布,将该公司的 SynthID 水印技术(已用于标记人工智能生成的文本、图像、音频和视频)扩展到合成生物学,其中的利害关系包括生物安全和公共科学数据库的完整性。

与数字水印不同,生物水印必须经受更严格的测试:它不仅必须在软件模型的输出中保持可检测性,而且在合成的物理蛋白质本身中也必须保持可检测性。据 DeepMind 称,SynthID Bio 清除了这一障碍。在实验室实验中,带水印的蛋白质设计保留了其生物学功能,同时保持可验证性,从而产生了该公司所描述的第一个带水印和生物功能的蛋白质结合剂。这项工作在《自然》杂志上题为“人工智能生成蛋白质的功能保留水印”的论文中有详细介绍。 更多相关背景,请参阅我们的人工智能资讯。

为什么要水印生物学?

生成式人工智能已成为生物学研究的真正工具。 DeepMind 指出了自己的产品组合:用于预测蛋白质结构的 AlphaFold、用于设计全新蛋白质的 AlphaProteo 和 ProteinMPNN,以及最近用于开发新噬菌体(感染细菌的病毒)的人工智能系统。然而,同样的工具也会带来新的风险。

据公告称,新的人工智能设计序列可以绕过传统的DNA合成筛选,因为筛选者不能再假设一个不熟悉的序列属于某些未被发现的自然生物体。另外,错误标记的合成 3D 结构可能会污染公共数据库并误导下游研究。这两个问题有一个共同的根本原因:目前没有人能够证明给定的生物设计来自何处。

两种水印方法,一个目标

SynthID Bio 根据数据类型调整其技术。对于蛋白质序列,它在生成序列时巧妙地指导氨基酸的选择,嵌入检测工具可以拾取的统计信号。对于预测的 3D 结构,它会对带有可检测签名的原子坐标进行小幅调整。

最有力的证据来自湿实验室验证。研究人员使用 SynthID Bio 支持的 ProteinMPNN 版本以及 DeepMind 的 AlphaProteo 结合剂设计方法,对针对三种蛋白质的设计进行了水印:VEGF-A、SARS-CoV-2 刺突蛋白受体结合域和 PD-L1。带水印的设计在命中率、以 KD 测量的结合亲和力以及自然序列多样性方面与未加水印的设计相匹配。换句话说,水印并没有降低分子完成其工作的能力。

对于蛋白质折叠,DeepMind 采取了不同的路线:团队对 AlphaFold 3 扩散网络的部分进行了微调,以便将水印功能直接构建到模型的权重中。这意味着无论谁运行模型,每个预测的结构都带有可检测的签名,而该公司报告称该方法保留了 AlphaFold 3 的预测准确性,提供近乎完美的可检测性,并能抵御数字噪声或微小的坐标变化。

生物安全“瑞士奶酪”防御的新层面

DeepMind 将 SynthID Bio 视为分层生物安全模型中的一层——“瑞士奶酪”方法,其中多个独立的保护措施各自覆盖了其他保护措施的盲点。 DNA 合成筛选位于最前线:将数字蛋白质设计转变为物理分子需要从合成提供商处订购 DNA,后者根据已知威胁的数据库筛选请求。今天验证一个不熟悉的订单可能需要进行详尽的手动审查,这会阻碍合法的研究。嵌入式水印向提供商提供一个自动信号,表明订单源自具有内置保护措施的可信模型。

DeepMind 引用的独立专家也赞同这一框架。生物安全政策专家兼科学政策咨询公司负责人莎拉·卡特 (Sarah Carter) 表示:“SynthID Bio 是追踪生物设计来源难题的重要组成部分。”她补充说,水印让开发人员能够引领安全性,并让合成供应商简化筛选。 Twist Bioscience 的政策和生物安全副总裁 James Diggans 对该论文提供了早期反馈,他称水印是“生物安全工具箱中一个有前途的新补充”,可以将审查重点放在需要更仔细审查的序列上。

相同的出处信号可以保护开放的科学存储库,例如接受公众提交的蛋白质数据库、UniProt 和 GenBank。随着人工智能生成的生物学的积累,SynthID Bio 可以在合成条目污染其他研究人员和生物安全决策所依赖的记录之前对其进行标记或验证。

限制,以及接下来会发生什么

DeepMind 坦言该系统不防篡改。使水印能够抵御故意的对抗性删除被列为一项关键的公开挑战,该公司建议将 SynthID Bio 与类似于 C2PA 的来源元数据标准(用于数字媒体的内容凭证方案)或人工智能生成的生物数据的中央存储库配对。

范围也正在扩展到蛋白质之外。在与斯坦福大学 Hie 实验室和 Arc 研究所持续合作的过程中,DeepMind 将 SynthID Bio 集成到先进的基因组模型 Evo 2 中,并用它为 Evo 2 设计的噬菌体的基因组添加水印。细菌培养物的早期实验室测试证实带水印的噬菌体仍然具有功能,该公司表示即将发布技术手稿。

对于人工智能开始编写自然界中从未存在的生物代码的领域,能够回答“谁制造了这个,用哪个模型制造的?”正悄然成为基础设施。 SynthID Bio 是朝着这个方向迈出的早期、谨慎的一步——其创建者坚称这是对生物安全堆栈其余部分的补充,而不是替代。有关人工智能研究如何发展的更多信息,请关注最新的人工智能发展,因为实验室不断将生成模型更深入地推向自然科学。

保持人工智能领先地位

在我们的主页上关注完整的故事和更多内容:阅读更多人工智能新闻 →