由 Biohub、美国能源部和美国国立卫生研究院领导的一个联盟宣布承诺投入 18 亿美元,用于生成并公开共享训练预测性人工智能生物学模型所需的数据——研究人员称之为“虚拟细胞”的追求。
该公告于周三在加利福尼亚州雷德伍德城发布,汇集了联邦机构、慈善机构和世界上三个最著名的人工智能组织,Biohub 称其为迄今为止生成人工智能就绪生物数据的最大协调承诺。 更多相关背景,请参阅我们的AI最新动态。
谁为什么付费
18 亿美元的数字结合了来自多个合作伙伴的资金、数据、计算和新测量技术:
- Biohub 以其 5 亿美元的创始承诺来支持这一努力。其中,4亿美元用于支持新的测量技术,扩大生物学家实际观察的范围:冷冻电子断层扫描,可解析细胞内的近原子细节,以及先进的显微镜,旨在以当前实验室工作流程无法达到的规模和速度对细胞进行成像。
- 能源部将在五年内通过其科学办公室在实验室测量、建模和计算方面投资超过 5 亿美元。
- NIH 将协调通过先前联邦投资超过 5 亿美元开发的数据集、存储库和知识库的贡献,Biohub 与该机构合作,标准化这些用于 AI 模型训练的数据集。
- Google DeepMind、Isomorphic Labs 和 Meta 共同向虚拟生物学计划投资 3 亿美元,这项国际努力于 2026 年 4 月首次宣布,今天的扩张正式正式启动。
其结果将是全球研究界的开放资源,而不是锁定在任何一家公司内部的专有数据集。
扩展,而不是开始
今天的公告正式确定并扩大了虚拟生物学计划,该计划于 2026 年 4 月首次宣布,其任务是协调跨机构和科学学科的数据生成。四月份的发布建立了框架;新的承诺为其注入了联邦资金、联邦数据和私营部门投资。
分工很重要。美国能源部拥有世界一流的计算能力和国家实验室仪器。美国国立卫生研究院带来了数十年联邦资助研究中积累的标准化数据集——这种精心策划的纵向生物数据是任何一个实验室或公司都无法再生的。 Biohub 是一家由科技慈善事业支持的研究组织,它充当整合中心,将这些来源规范化为人工智能模型可以实际训练的格式。
“虚拟细胞”大挑战
该计划的既定目标是使科学家能够以数字方式进行实验:在接触移液器之前预测细胞对药物、遗传扰动或疾病状态的反应。
Biohub 科学主管 Alex Rives 在声明中表示:“准确的生物学预测模型可以让科学家以数字化方式进行实验,从而极大地加速科学发现。” “由此得出的见解可以加深对疾病的理解,并开辟全新的治疗途径。”
“由于这种潜力,虚拟细胞的创建是下一个科学时代最重要的挑战之一,”里夫斯补充道。 “这需要在国家和国际范围内协调数据生成工作,这就是这些合作伙伴聚集在一起的原因。”
为什么数据(而不仅仅是模型)是瓶颈
生物学领域的人工智能已经产生了里程碑式的成果——DeepMind 的 AlphaFold 系列证明神经网络可以以实验精度预测蛋白质结构——但这些系统是根据数十年精心策划的公共数据进行训练的。从预测整个细胞如何响应干预措施到建模细胞相互作用等前沿问题,所需要的数据在很大程度上尚不存在于人工智能就绪的形式中。
这就是该倡议所针对的差距。合作伙伴没有发布另一个模型,而是资助乏味的科学基础设施:将细胞反应数据扩展到比迄今研究的更多的细胞类型和条件的干预措施,构建和验证更大规模、更快和更准确地研究细胞及其相互作用的技术,并组装实验室外部可以实际使用的共享存储库。
扩张还具有防御性的意义。在《黑客新闻》上,这一声明引起了广泛关注,评论者将开放数据承诺与现任美国政府从政府服务器上删除以前公开的研究数据集进行了对比——前沿的开放科学与其他地方的紧缩之间的紧张关系。
人工智能在药物发现中意味着什么
对于制药和生物技术行业来说,传达的信息是基础数据正在成为共享的公共设施。 Alphabet 的药物设计公司 Isomorphic Labs 和拥有自己的基础人工智能研究和蛋白质结构工作的 Meta 都认为,更好的共享数据将加速每个人的模型,包括他们自己的模型。
如果该计划成功,近期的交付成果将是扩大细胞反应数据集,涵盖更多的细胞类型和条件,以及经过验证的测量技术,缩短从假设到高质量训练数据的路径。长期奖励是足够好的模拟,可以在第一次湿实验室实验之前对候选药物进行数字分类。
科学界被明确邀请参与:Biohub 的公告最后公开呼吁“全球科学界”加入该项目。
有关机器学习如何重塑生命科学的更多信息,请参阅 AI Buzz Wire 的人工智能研究报道。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →