据 The Decoder 8 月 28 日发表的一份报告称,谷歌 DeepMind 已将其多智能体 AI 联合科学家系统从假设生成器扩展为实验室综合研究合作伙伴,负责规划实验、编写代码、控制实验室设备并生成科学手稿。该系统基于谷歌当前的 Gemini 模型构建,已在材料科学、生物学和计算机科学三个学科领域提供了经过实验验证的结果。

扩展后的联合科学家于 2025 年 2 月首次在 Gemini 2.0 上引入,在事实检查和文献综述方面存在已知的弱点,现在运行着研究人员所谓的闭环研究工作流程。它从研究问题中得出假设,创建实验计划或机器可读的实验室协议,执行它们,分析结果并将其写入——同时单独的验证模块根据其生成的代码的执行日志交叉检查文本中的每个数字声明,这是对困扰自主研究代理的捏造结果问题的直接攻击。

这项工作是围绕自主研究代理的最新人工智能发展的最新里程碑,也是第一个将基于法学硕士的系统与这一级别的物理实验室硬件相结合的工作之一。

从假设到湿实验室方案

在材料科学领域,DeepMind 将 Co-Scientist 与半自动高温炉配对。该系统为以前主要通过危险蚀刻生产的广受欢迎的二维材料找到了一条更安全的合成途径,并生成了针对其所使用的特定熔炉量身定制的完整生长配方。经过 25 轮人工改进迭代后,该团队生产出了其特性与目​​标材料相似的层状结构——尽管原子结构的最终确认仍有待确定。

在第二次实验中,第一次尝试成功合成了三种半导体薄膜。 Co-Scientist 使用 Gemini 3 Deep Think 进行直接设备控制,将配方开发时间从几天缩短到几分钟。人类仍然必须手动加载样品和前体材料,而且快速模式产生的晶体比精心优化的配方更小、更不均匀——这提醒人们,循环还没有完全放手。

在生物学中,该系统自主构建了一个图像分析管道,可以预测基因工程大肠杆菌菌落在不同化学浓度下形成的模式。使用 Gemini 3 Pro Image 生成的预测与未发布的实验室结果(四个形状特征中的三个)相匹配。研究人员指出,该系统仅在已知条件之间进行推理,尚无法预测全新实验系统中的行为。

一个设计另一个人工智能的自主人工智能

除了初始设置之外,计算机科学实验的运行没有任何人为参与。联合科学家设计了“Agent_H”,这是一种医疗人工智能架构,可以对传入的查询进行分类,并行生成数十个候选响应并对其进行优化。在纠正过长的响应后,Agent_H 在健康基准方面优于六个前沿模型(包括 GPT-5 和 Claude Opus 5)。

然后是现实检验。三位获得委员会认证的医生在九个类别的盲法比较中对反应进行了评分,Agent_H 与基线 Gemini 3.1 Pro 相比仅在一个方面显示出统计学上的显着优势:潜在有害反应的风险较低。自动基准评估器与医生的判断的相关性很弱。

基准分数和临床实用性之间的差距可以说是该研究最重要的发现。研究人员表示,高自动化分数并不一定意味着系统从医学角度提供了更好的答案——这引发了关于人工智能基准实际测量的令人不安的问题。

将制造成本从 46% 削减至 4%

自主研究智能体的核心失败模式是捏造:当智能体因产生良好结果而获得奖励时,它就会有动机去弥补。先前的分析表明,现有系统的制造率为 80% 至 100%。

联合科学家用两种机制来解决这个问题。该系统会因捏造或剽窃的内容而受到处罚,并且一个单独的验证模块会根据其执行代码的实际结果交叉检查每个数字声明。在一项涉及 30 位领域专家和对 150 篇自主生成的论文进行 450 次独立评审的双盲研究中,结果是显而易见的:

  • 4% 的论文在可靠性模块激活的情况下得出了关键结果,而 46% 没有激活可靠性模块。
  • 比较系统达到90%关键结果制造。
  • 完全捏造的数据从未出现在联合科学家的输出中,但出现在比较系统论文的 44% 中。
  • 近乎抄袭的内容从 60% 下降到 16%
  • 集成安全架构拒绝了 98.7% 的潜在有害研究方向。

尚未准备好取代科学家

仍然存在残余错误。该系统倾向于选择性报告,施米德加尔承认它“在论文中编写了高度可信的方法,但与实际代码不符”。材料科学配方是否能转移到其他实验室还是一个悬而未决的问题,而生物学结果虽然很有希望,但只涵盖了一小部分预测。

尽管如此,轨迹还是清晰的。十八个月前最初作为假设生成器的系统现在可以在其声明错误时计划实验、操作熔炉、分析输出并起草手稿和文档,并进行日志级别验证。实验室助理和自主研究人员之间的差距正在缩小,而科学中那些顽固地由人类控制的部分——判断、味道和物理样本加载——正变得更容易准确地看到,因为其余部分正在自动化。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →