OpenAI 于 2026 年 9 月 6 日表示,它已经实现了去年秋天宣布的目标:在今年 9 月之前派出一名“自动化研究实习生”。在一篇题为“研究加速:OpenAI 内部的观点”的新博文中,该公司还首次披露了人工智能代理在其自己的研究组织中的融入程度——到 8 月中旬,该组织为每个人类工作日使用了 3.1 个代理工作日的工作量。

这一里程碑由 Engadget 和 Unite.AI 最先报道,是迄今为止 OpenAI 在谈论 AI 加速 AI 研究时的最清晰的定量描述。对于关注更广泛故事的读者来说,这符合我们持续的人工智能研究报道,即前沿实验室如何围绕代理重组工作。

“自动化研究实习生”的实际含义是什么

该博客文章精确地定义了目标:一个可以在人类指导下执行明确定义的研究任务的系统,包括熟练的研究人员需要几天才能完成的任务。根据 OpenAI 自己的测量,该标准现已达到,大致按照该公司去年秋天宣布目标时设定的时间表。

下一个目标更加雄心勃勃。 OpenAI 表示,到 2028 年 3 月,它将在自动化人工智能研究人员方面取得“重大进展”——这是一个在人类监督下工作的系统,以推动深度学习和对齐研究,从而实现迭代式自我改进。该公司谨慎地指出,人类仍然会设定研究优先事项,判断哪些想法和结果值得追求,并决定是否扩展、暂停或部署任何给定的系统。

索赔背后的数字

这篇文章中最引人注目的数字描述了 OpenAI 研究人员的日常工作在 2026 年发生了多么彻底的变化:

  • 每个人工作日 3.1 个座席工作日。 2026 年 6 月之前,整个研究组织的座席总运行时间仍低于总人力。到 8 月中旬,按照标准的八小时工作时间衡量,特工付出的努力是人类指挥他们的工作量的三倍多。
  • 中位研究人员每天花费超过 600 美元。 在年初,按代理使用情况排名的中位研究人员仅在尝试编码代理。到 8 月中旬,研究人员每天运行代理的中位数,每天消耗超过 600 美元的推理费用(以 API 价格计算)。
  • 第 90 个百分点每天超过 7,000 美元。 研究组织中最重的用户现在每天消耗超过 7,000 美元的代币,运行高度并发的工作流程,有四个或更多代理同时工作。
  • 创纪录的实验量。 自 2025 年 1 月开始跟踪以来,每个活跃实验者的实验数量在 2026 年 8 月创下历史新高。

OpenAI 将生产力的提升主要归功于其编码代理 Codex 的采用,同时承认自 2025 年以来可用计算也大幅增长 - 因此收益是更多代理、更好的代理以及更多运行它们的硬件的组合。

代理实际上在做什么

为了对代理活动进行分类,受 O*NET 职业分类系统的启发,OpenAI 使用了 Epoch AI 发布的研究工作分类法。它将人工智能研究和开发分为六个阶段:决策、设计、构建、运行、分析和沟通。

2026 年 1 月至 8 月期间,所有六类代理活动均有所增加。1 月,主要用途是研究和基础设施代码;2026 年 1 月,主要用途是研究和基础设施代码;该类别不断扩大,技术帮助和监测实验运行显着增长。相比之下,高层规划仍然只占代理输出代币的一小部分——战略决策仍然由人类负责。

有趣的是,该帖子报道称,OpenAI 的研究人员发现编码代理擅长对内部研究基础设施进行故障排除,而以前需要在办公时间解决基础设施问题的多个团队不再需要这样做。

为什么这个里程碑比 OpenAI 更重要

该公告是在敏感时刻发布的。立法者、安全研究人员和竞争对手都在关注人工智能系统可以有意义地加速人工智能研究本身的证据——这种机制最有可能将时间压缩到更强大的系统。 OpenAI 自己的首席科学家在同一天发表了一篇配套文章,警告说还没有实验室能够很好地解决对齐问题以保持全速扩展,这与生产力数字形成鲜明对比。

其经济影响同样显着。如果一个研究组织每个研究人员每天在推理上花费数千美元——并将其视为便宜货——那就表明企业人工智能支出的走向。代理工作日正在成为一种可购买的投入,就像计算本身一样。

怀疑论者会指出,OpenAI给自己做了功课:“自动化研究实习生”标准是内部定义和衡量的,3.1:1的比例既统计了直接启动的代理,也统计了下游的子代理。该公司的数据还融合了不同难度级别的编码、监控和分析工作。

尽管如此,方向还是明确的。八个月前,在世界上资金最充足的人工智能实验室之一,智能体的时间落后于人类的时间。今天,它的比例是三比一——实验室的领导层已经在制定下一个里程碑,即 2028 年 3 月之前的自动化人工智能研究人员,这只是“何时”而不是“是否”的问题。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →