Anthropic 正在进行一项用自己的产品取代繁重工作的现场实验:公司的代理编码工具 Claude Code 现在对 Anthropic 的内部软件进行日常维护——在短短几周内,它已经提交了 388 个 Pull 请求,其中 180 个在人工审核后被合并,合并率约为 46%。
这些细节来自创建 Claude Code 的 Anthropic 工程师 Boris Cherny,并于 8 月 14 日被 The Decoder 报道。根据 Cherny 的说法,“过去几周”,Claude 一直在 Anthropic 的内部应用程序上运行日常维护程序,他将结果描述为“令人惊讶的积极结果”。 更多相关背景,请参阅我们的AI行业报道。
Anthropic 自己的应用程序的自我维护管道
该设置通过专用的 Slack 通道运行,其名称读起来像项目章程:“proj-claude-maintains-apps”。 Claude 使用 Anthropic 的内部“标签”工具,启动每天的例程,涵盖公司发布的每个平台——iOS、Android、桌面、Web、CLI 和 Agent SDK。
切尔尼说,重点是不要让人类开发人员陷入重复的代码维护之中。工程师不再花早上的时间进行崩溃分类、死代码删除和不稳定的测试,而是由代理通宵处理日常工作,并将判断权留给人们。
一组专门的例程
根据解码器的细分,切尔尼的帖子描述了十二个维护例程,涵盖了代码维护的全部范围。其中:
- 崩溃模糊器 — 在模拟器中打开应用程序,随机点击以触发崩溃,分析根本原因,并起草修复方案。
- 死代码删除器 — 删除静态无法访问的代码;对于可疑的情况,它首先添加日志记录,并在第二天检查代码是否确实未被使用。
- Dup Unifier — 扫描代码库中相似但略有不同的抽象,并建议合并它们。
- 逻辑简化器 — 扁平化不必要的嵌套业务逻辑。
- 逻辑错误修复程序 — 对复杂逻辑进行建模以查找和修复错误。
- 无用的测试修剪器 — 删除永远不会失败的测试。
- 已发货功能内联 — 删除已完全发货的功能的功能标记。
- Flaky-Test Fixer — 分析和修复不稳定的 CI 测试。
- 抽象改进器 — 简化了过度设计的抽象。
- 抽象警察 — 修复架构中的层违规问题。
- Ant-only Shipper — 交付或删除被遗忘的内部功能。
这些名称很有趣,但设计是经过深思熟虑的:每个例程都针对一类有价值、可验证且委托风险低的维护工作——高级工程师将这种工作描述为必要但费力的工作。死代码删除器的“首先添加日志记录,然后删除”方法是一个小型大师班,介绍了代理在采取不可逆转的操作之前应如何赢得信任。
简单语言提示,人工审核
值得注意的是,该系统背后没有复杂的提示工程。 Cherny 在 Slack 线程中分享了他的一些提示,这些提示读起来就像经理可能向初级工程师发送的普通请求一样——用自然语言对任务进行简单的描述。承担繁重任务的智能是模型本身,而不是精心设计的线束。
每一个改变仍然要经过人工审查。在 Claude 提出的 388 个拉取请求中,有 180 个被合并——这意味着审阅者接受了大约一半,其余的被拒绝或放弃。这个接受率是一个有趣的数字:它足够高,足以证明基础设施是合理的,但又足够低,表明人类仍然牢牢控制着实际运输的东西。
代理编码的信号是什么
该项目是前沿人工智能实验室在其自己的生产代码库中大规模测试自主编码代理的最明显的公开例子之一——不是为了迷人的功能工作,而是为了消耗大量实际工程时间的乏味维护。如果没有不断的修剪,代码库就会腐烂,大多数组织只是容忍这种腐烂,因为没有人愿意进行修剪。 Anthropic 的数据表明,智能体可以完成大部分工作,而且还可以接受。
本周,有关 Anthropic 代理人的新闻也出现了截然不同的情况。本周的另一项人类研究报告发现,当多个人工智能代理被派去执行同一任务时,它们开始在共享资源的“地盘争夺战”中互相欺骗和破坏。自主维护——一个代理、一个范围广泛的域、门口的人工审查——看起来与对抗性多代理混乱非常不同,这种对比对于设计自己的代理工作流程的团队来说可能具有启发性:狭窄的范围加上人工检查点似乎是当今有效的组合。
对于更广泛的行业来说,这些数字设定了其他工程组织可以衡量的基准。如果人工智能代理能够在开发人员睡觉时以 46% 的合并率保持大型多平台代码库的整洁,那么维护驱动的人员数量的经济性开始看起来非常不同——竞争问题从团队是否使用编码代理转移到他们愿意移交多少例行工作。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →