Anthropic 发表的研究表明,自动化人工智能系统可以可靠地修复模型的对齐故障,这一结果可能会重塑人工智能行业中心安全工作的完成方式。这篇题为“自动化研究人员可以可靠地缓解对齐失败”的论文于周五发布,并由 TechCrunch 详细介绍。

这项研究来自 Anthropic 的研究员计划,由陈月汉领导。其核心主张令人震惊:当该公司的自动化研究系统针对衡量特定失调行为的十个基准时,它们提高了每一项的性能,而不会降低模型的整体能力。对于一个努力使安全工作与模型规模保持同步的领域来说,这是一个值得注意的结果。 更多相关背景,请参阅我们的AI最新动态

这篇报道发生在人工智能安全报道繁忙的时期。在此之前的一个夏天,代理不当行为占据了头条新闻,从 OpenAI 关于奖励黑客代理的内部报告到呼吁对 Hugging Face 违规事件进行独立调查。 Anthropic 的新论文从相反的方向解决了这个问题:它不是询问智能体如何行为不当,而是询问是否可以信任其他智能体来解决这些问题。

论文实际报道内容

论文中描述的系统称为自动对齐研究人员(Automated Alignment Researcher,AAR)。 AAR 并没有取代研究过程,而是复制了大部分研究过程:每个自动化系统都会搜索可用的文献,提出一种方法,并使用该方法训练模型大约 30 分钟。然后该过程会重复几次迭代。

选择机制很简单。移动基准的方法被保留;不这样做的方法将被丢弃。这个循环让系统能够以人类团队无法比拟的规模快速运行,并行测试许多研究方向并只保留有效的内容。

据该论文称,结果是全面一致的。在涵盖特定未对准行为的所有十个基准测试中,自动化系统产生了可测量的改进,而不会损害整体模型性能——这是使对准工作变得困难的常见权衡。

“总的来说,这些结果提供了早期证据,表明训练后自动对齐可能在短期内变得实用,”论文指出。

以 1/37 的成本击败人类

论文中被引用最多的段落是将 AAR 与人类对应物直接进行比较的段落。 Anthropic 并没有对这种比较进行对冲。

论文中写道:“最好的 AAR 方法平均在六个小时内就击败了经验丰富的人类提出的方法。”它尖锐地补充道,“人类指导的研究方向不会带来更强的表现。”

经济学也同样直率。作者写道:“AAR 的 API 推理成本约为每小时 4 美元,而我们为人类研究人员支付的费用为每小时 150 美元。”这是近 40 倍的成本差异,这也解释了为什么实验室认真对待自动化研究,而不仅仅是出于好奇。

为什么成本差距很重要

比对研究的成本很容易被低估。每个候选人的干预措施都必须根据基准进行实施、培训和评估,但大多数候选人都失败了。如果一个系统能够以 API 调用的价格连续运行该搜索循环,那么尝试一个想法的边际成本接近于零。限制从人员数量转向计算。

人择本身标记的局限性

该论文对结果未证实的内容持坦率态度。自动化系统仅在基准实际反映重要的一致性目标的情况下才起作用,而构建和维护捕获现实世界不当行为的基准仍然是该领域的一个悬而未决的问题。

还有一个很容易被忽视的依赖性:自动化研究人员利用现有的方法文献。维护和扩展文献本身就是一项重要的工作,而一个仅重新混合已知技术的系统可能会达到人类创造力不会达到的上限。

这些警告很重要,因为研究的长期意义取决于它们。如果基准衡量的是错误的东西,AAR 可以优化其方式以获得强劲的数据,同时基本风险保持不变。人择的框架——“早期证据”,而不是解决方案——反映了这种不确定性。

递归自我完善的一步

这篇论文还引发了一场关于递归自我改进的更大争论,即人工智能系统最终可以改进产生它们的训练过程。使用其他 AI 模型训练 AI 模型已成为前沿实验室的热门目标,而 Anthropic 的结果是对狭窄领域内的情况进行了早期、具体的观察。

逻辑很简单。如果模型能够可靠地改进自己的对齐训练,那么同样的机制可能会适用于更广泛的训练实践——包括能力工作。 TechCrunch 指出,人类人工智能研究人员最终可能会在这一过程中变得不那么重要,论文本身也参与了而不是回避这种可能性。

接下来看什么

三个问题将决定这个结果是否具有普遍性。首先,该方法是否适用于 Anthropic 测试的十个基准之外,即更混乱且不太明确的故障模式。其次,是否能够足够快地解决基准维护问题以保持自动化研究的诚实性。第三,其他实验室是否发表了类似的结果,这将把一篇论文变成一个行业方向。

目前,这一发现虽然有限,但却是真实的:在人类测试的特定对齐任务上,自动化研究人员的表现优于经验丰富的人类,速度更快,成本也低得多。人工智能行业的安全方面可能是人工智能研究人员(而不是人类)承担大部分工作的首要任务。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →