一个新的基准正在挑战人工智能行业如何衡量科学能力,其初步结果让前沿实验室感到羞愧。 Terminal-Bench-Science 0.1 是由斯坦福大学的研究人员和流行的 Terminal-Bench 编码基准背后的团队于本周推出的,它根据工作科学家贡献的真实科学研究工作流程来评估人工智能代理,而经过测试的最强大的模型,即通过 Claude Code 运行的 Claude Opus 5,仅完成了 30% 的任务。
该基准的公告页面直白地描述了其指导原则:应该为人工智能的科学能力设定标准的是科学家,而不是模型开发人员或数据供应商。该项目是与世界各地研究机构的领域专家合作构建的,其首次发布包括涵盖生命科学、物理、地球科学、数学和工程领域的 70 项任务。
它与教科书基准有何不同
大多数科学的人工智能评估测试知识:多项选择题、教科书问题、标准化练习。相反,终端科学衡量的是代理是否能够执行技术要求高、耗时的工作流程,这些工作流程占据了实际研究人员的时间——这种工作不会出现在考试中。任务在现实环境中运行,评分基于具体工件:分析、模拟、证明、代码和数据产品,通过可重复的特定于任务的测试进行检查,而不是判断模型或多项选择评分。
该设计反映了人工智能助手最终应该为科学做什么的理论。该基准的作者认为,智能体不应取代科学判断,而应该接管执行层——在计算机中运行实验、处理数据、检查证据——让科学家们能够从事人类判断最重要的研究部分:定义问题、形成假设、解释结果和交流发现。
该项目还明确被构建为一个移动目标。许多基准测试一旦发布就被放弃——该公告称其为“要发布的论文”问题——终端基准科学被设计为一个沿着前沿发展的连续基准测试,定期发布旨在保持评估领先于模型进展并防止污染驱动的分数膨胀。
第一个排行榜:离可靠还有很长的路要走
v0.1 排行榜本周在 Hacker News 上引起了广泛关注,显示出排名的急剧下降:
- 克劳德作品 5(克劳德代码):30.0%
- GPT-5.6 Sol(法典):22.4%
- 克劳德寓言 5(克劳德代码):21.4%
- 克劳德作品 4.8(克劳德代码):10.5%
- GPT-5.6 Terra(法典):8.6%
- GLM 5.3(克劳德代码):8.1%
- Kimi K3(克劳德代码):7.1%
- Grok 4.6(Grok 构建):7.1%
- GPT-5.6 Luna(法典):3.3%
结果表明,对于代理来说,科学工作流程仍然比软件工程困难得多,原始的终端基准和竞争对手的编码基准测试的分数迅速攀升。最佳可用系统的分辨率为 30%,这意味着在 10 个实际研究任务中有 7 个任务中,即使是顶级智能体搭配强大的工具也无法产生可验证的正确工作。
模范家庭中的传播也具有启发性。 Claude Opus 5 和 Claude Opus 4.8 之间的差距(近二十个点)以及 GPT-5.6 变体 Sol、Terra 和 Luna 之间的差距表明结果质量在多大程度上取决于模型和代理工具的相互作用,而不仅仅是原始模型智能。每个高分条目都使用代理编码工具(Claude Code、Codex、Grok Build),强化了新兴共识:脚手架与基础权重一样具有决定性。
为什么科学家建立自己的基准
该基准的框架带有微妙的制度论点。公告称:“科学的风险太高,其基准必须反映科学界的优先事项,而不是外部利益。”该项目为工作研究人员提供了一种直接机制,可以对他们实际需要自动化的任务进行编码,并根据可验证的标准来控制供应商“加速科学发现”的主张。
这很重要,因为营销与现实之间的差距会产生真正的后果。如果前沿实验室声称他们的代理人可以加速研究,而独立的、专家设计的评估显示解决率只有个位数到 30%,那么基于这些声明的资助决策、招聘计划和实验室政策就会继承错误。持续的、社区拥有的基准是一种纠正措施:它们将模糊的主张转化为可重复的数字。
研究机构的信号
For universities, national labs, and R&D teams weighing when to deploy agents, the benchmark offers something vendor demos cannot: a community-maintained measurement of where the reliability line actually sits. A resolution rate in the teens or twenties means these systems are best treated today as assistants that require review, not as autonomous executors of experimental pipelines. The task categories — spanning life, physical, Earth, mathematical, and engineering sciences — also give domain specialists a template for contributing workflows from fields that generic benchmarks routinely overlook.
更广泛的行业背景强化了时机的重要性。 Science has become one of the most heavily promoted use cases for frontier AI, with labs touting contributions to materials discovery, protein science, and mathematics.这些说法很难审核:科学成果的验证速度很慢,而热情的传播速度比复制速度更快。 A benchmark that grades verifiable artifacts on real workflows gives research institutions a way to separate demonstrated capability from demonstration theater — and to track, release by release, whether agentic progress in science is compounding as quickly as it is in software engineering, where Terminal-Bench first made its name.
对于人工智能行业来说,v0.1 的信息是一把双刃剑。前沿显然正在进步——Opus 5 的 30% 高于旧版 Opus 4.8 的 10.5%——但其上限仍远未达到真正实验室所需的可靠性。该基准测试的设计者表示,定期发布的版本将准确跟踪差距缩小的速度。在代理研究工具中观察新兴人工智能趋势的科学家们现在有了他们自己建立的衡量标准。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →