Anthropic 本周首次对其自身的开发流程进行了审视,披露其 Claude 模型现在“领导”了该公司 26% 的人工智能研发工作,而 2026 年 2 月这一比例还不到 1%。这些数据出现在公司博客文章中,题为“了解前沿实验室内人工智能开发速度的衡量标准”,该文章由 Anthropic 于 9 月 17 日发表,并由路透社、华盛顿邮报和其他媒体报道。

这篇文章部分是为了提高透明度,部分是为了论证:Anthropic 希望其他前沿实验室也发布相同类型的数据,以便公众和政府能够追踪人工智能交付构建人工智能的关键的速度。 更多相关背景,请参阅我们的AI最新动态

追踪人工智能发展的三个数字

该公司提出了三项衡量标准,称其阐明了前沿实验室内部的发展速度:人工智能研发有多少是由人工智能本身进行的、人工智能代理的行为受到监督的程度以及计算在能力工作和安全工作之间的分配方式。

标题数据来自 Anthropic 所谓的研发自动化指数。该公司对公司完成的各种人工智能研发工作进行了分类,评估了当前每项任务的自动化程度,并使用研究小组 Epoch AI 开发的量表汇总了结果。该等级范围从 AL0(没有人工智能参与)到 AL5(人工智能完全自主运行,没有人参与),其中 AL3 意味着人工智能在人类的密切指导下“协作”完成大量工作,AL4 意味着人工智能“领导”,在人类监督下根据高级提示端到端地完成大部分任务。

据 Anthropic 报道,截至 2026 年 8 月,Claude 领导着公司 26% 的人工智能研发工作。 “AI协同”级别及以上的工作占比达到90%以上。对于人工智能研发工作的任何测量子集,克劳德都没有完全自主地运作。

30,000 个代理,一台监视器

第二个衡量标准涉及监督。 Anthropic 透露,截至 2026 年 8 月,大约有 30,000 名代理在该公司最常用的内部平台上随时进行研究和工程工作。

据帖子称,这些特工采取的每项行动在执行之前都会经过在线监视器,通常在几秒钟内。 Anthropic 表示,它分析了 8 月份研究和工程代理的超过 10 亿个决策,发现被监控器阻止或升级的活动比例为 0.002%。

在第三项测量计算分配方面,该公司表示,在检查的一周内,用于人工智能研发的计算中大约有 6% 分配给了安全领域。

在人类监督下打造自己的继任者

框架和数字一样重要。 Anthropic 的模型越来越多地参与构建下一代相同模型——研究人员称之为递归自我改进,《华盛顿邮报》的标题更直白地描述为聊天机器人“接管构建自己的继任者的工作”。

Anthropic 谨慎地在“人工智能引领”和“人工智能取代”之间划清界限。在 AL4,人类仍然可以监督并可以干预;该公司明确报告称,其研发工作中没有任何可测量的子集是在 AL5 上运行的。但趋势很陡:大约七个月内从不到 1% 上升到 26%,这表明如果目前的趋势保持下去,人工智能主导的工作份额可能会在本十年末之前超过一半。

该方法论确实存在局限性,人类学也这么说。其自动化评级是通过对公司自己的工作记录(包括 Slack 消息和内部文档)进行采样而得出的,并让人类和判断模型对每项任务的自动化程度进行评分。在盲测中,工作人员在不知道模型收集了哪些证据的情况下对任务进行了评分。该公司报告称,其模型评判与人类的一致程度与人类之间的一致程度相当:模型与人类的准确一致性为 59%,而人与人之间的一致性仅为 35%,并且模型和人类的评分在 97% 的情况下都处于同一水平内。

该公司还承认自己的方法中存在自我参照风险:Anthropic 使用自己的模型来帮助评估其系统,这可能意味着判断模型会犯与其正在检查的模型相同的错误。它认为,第三方验证才是真正的答案。

外面的眼睛来了

为此,Anthropic 表示,计划在公司内部嵌入来自多个组织的独立第三方评估人员,让他们能够访问与内部风险评估团队所拥有的内部流程、系统和数据相当的权限。外部人工智能研究非营利组织 METR 此前曾对 Anthropic 的离线监控平台进行过红队评估。

这一披露是在有关节奏的争论不断升级之际发布的。 Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 呼吁就放慢前沿速度进行协调,该公司指出,如果存在这种协调,预计其自身的数据将会发生变化。本周,Anthropic 和 OpenAI 也成为安全专家一封公开信的主题,他们认为实验室需要真正独立的安全评估人员。

竞争对手是否会效仿 Anthropic 的做法仍是一个悬而未决的问题。该公司认为,任何前沿开发商都可以使用公共方法定期发布这些措施。在此之前,关于人工智能构建人工智能的速度的唯一公开数据来自实验室本身。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →