据 MarkTechPost 10 月 10 日报道,Sakana AI 在《机器学习研究汇刊》(TMLR) 期刊上发表了一篇研究论文“Beyond Imitation”,描述了一种基于错误检测而不是模仿人类评审的法学硕士辅助同行评审系统。这家位于东京的实验室要回答的核心问题是:它能否找到一个人为的错误,而不是根据其输出与人类评审的接近程度来对人工智能审稿人进行评分?
该团队交付了两个工件:一个用于测量错误检测的矛盾基准,以及一个引导每个基线测试的多层审查 (MLR) 系统。这一结果的出现正值人们对利用人工智能支持同行评审的兴趣日益浓厚之际——这一过程因提交量激增而面临压力。有关人工智能如何重塑研究本身的更多信息,请关注我们的最新人工智能发展。
人为错误的基准
矛盾基准将错误植入真实论文中,并检查审稿人是否发现它们。研究人员从 ACL、AISTATS、CVPR 和 ICML 2025 以及 NeurIPS 2024 收集了 257 篇 CC 许可的论文,然后使用 Gemini 2.5 Pro 构建了每篇论文的主张、证据和方法的知识图谱。
严重性是在结构上定义的:节点与论文“主要主张”的距离决定了错误的中心程度。零距离击中了核心主张;较大的距离会影响支撑细节。然后,GPT-4.1 将每个距离的一个节点重写为矛盾,总共产生 1,164 个数据点。 o3 评委对每条评论打十分。在干净的纸上,法官的准确率达到了 99.9%,并且对手动确认的渔获量显示出 86.8% 的敏感度——这意味着报告的检测分数实际上可能是保守的。
多层审核如何运作
MLR 是一个代理系统,它在批评论文之前先理解它,由在现成的 Claude 模型上运行的三个专门代理组装而成 - 没有 GPU 集群,也不需要微调:
- 附录代理 (Claude Haiku 3.5):总结附录中的实验和实现细节。
- Literature Review Agent(Claude Sonnet 4,可选):使用网络搜索将论文置于先前工作的背景中。
- 审查代理(Claude Sonnet 4):受计算机科学家 S. Keshav 著名的“三遍方法”启发,运行三遍提示链 - 首先是高级大纲,然后详细阅读标记弱点、假设和差距,最后将所有代理输出合并为优势、弱点、问题、建议、分数和待办事项列表。
PDF 直接传递给模型,因此图形和方程可以在处理过程中幸存下来。该系统最多可读取 10 页正文,Sakana 估计每次评论的成本约为 0.47 美元。
结果:设计和模型选择都很重要
MLR 在基准测试中主导了所有四个系统的测试。通过四次独立审查,它发现了 73.43% 的核心主张(零距离)矛盾和 40.95% 的总体矛盾。最好的基准是一个名为 AgentReview 的系统,它只处理了 14.81% 的核心索赔。即使是一次 MLR 审查也能发现 60.79% 的核心声明错误。
消融研究将设计的贡献与模型的选择分开。在现有审查流程中将 GPT-4.1 替换为 Claude Sonnet 4,将核心声明检测率从 14.56% 提高到 35.40%,而 MLR 的多代理设计比单次审查增加了大约 25 个百分点。随着错误远离主要主张,检测准确性下降,作者称主要主张支持严重性评分。
现实世界的数据更加混乱,情况变得更加黯淡。在 WithdrarXiv-Check(一组 211 篇实际撤回的 arXiv 论文)上,MLR 在“相似”匹配上的得分为 26.07%,在精确匹配上的得分为 16.11%,而且该系统仍然容易受到手稿文本中植入的隐藏提示注入的影响。换句话说,阅读真正的撤回论文比捕捉综合矛盾要困难得多。
这对同行评审意味着什么
这项研究最实际的收获可能是它最不吸引人的地方:系统设计和模型选择都极大地推动了错误检测,而在判断之前阅读的审稿人发现的错误比人类审稿文本中模式匹配的错误要严重得多。这种区别很重要,因为大多数人工智能辅助审查的先前工作都针对与人类判断的一致性进行了优化——这一指标奖励听起来自信的一致性,而不是真正的审查。
Sakana 的结果并不表明人工智能已经准备好取代人类审稿人——一个能够漏掉真正撤回论文上的大多数错误并且可以通过嵌入式提示进行操作的系统,最好将其视为辅助层,而不是权威。该基准的综合错误也比同行评审中主导真正分歧的统计模糊性和有争议的解释更清晰,因此针对既定矛盾的表现应被视为上限,而不是承诺。
但每次审核的费用约为 0.47 美元,是所有测试系统中错误检测率最高的,MLR 指出,近期人工智能审核员将处理矛盾的首轮筛选,而人类审核员则专注于机器仍然无法做出的判断。尝试 LLM 辅助评审的期刊和会议组织者现在拥有公共基准和强大的基线来衡量自己的系统 - 如果 73.43% 和 14.81% 之间的差距持续存在,则明确表明阅读架构比原始模型大小更重要。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →