Anthropic 发布了一份详细的工程说明,说明了它如何在两周的冲刺中使 claude.ai 和 Claude 桌面应用程序的速度提高了大约三倍,而奇怪的是,大部分工作都是由 Claude 自己完成的。这篇文章发表在 Anthropic 的工程博客上,描述了从单个 Slack 通道运行的性能活动,每个线程中都有人工智能模型,查找瓶颈,构建基准,交付改进,并观察每次部署。
以第 75 个百分位数衡量的数字是相当可观的。新加载 claude.ai 时,进入可输入页面的时间从 3.1 秒下降到 0.55 秒。启动新的 Claude Code 会话从 0.8 秒下降到 0.3 秒,加载 Claude Cowork 云会话从 2.6 秒下降到 0.73 秒。总的来说,Anthropic 估计这些改进每天可以节省数以万计的用户等待时间。 更多相关背景,请参阅我们的AI新闻。
先测量,再移动
冲刺是从测量而不是代码开始的。该团队使用 Claude 通过 Datadog MCP 服务器分析使用数据,确定了占活动 95% 的四个用户旅程:启动应用程序、开始对话、加载现有对话和发送消息。在网络和桌面上,这些旅程分为十三个不同的测量,团队添加了仪器,直到每个测量都可以直接比较——从用户交互开始,在结果呈现后结束。
基线确定后,团队制定了大约二十个精心挑选的项目列表,每个项目都针对一个特定的旅程,并让 Claude 以毫秒为单位估计每个项目的影响,以设定冲刺目标。该计划提前落地:人类报告称,到了第三天就达到了 13 个目标中的 12 个。这为克劳德留下了寻找更多机会并提出新工作流程的空间,这些工作流程很快就进入了自己的完整项目,并推动结果超出了最初的目标。
实际发货的内容
这些技术变化读起来就像现代网络性能工作的清单。为了更快地启动,该团队将静态编辑器嵌入到 HTML 中,以便用户可以在 React 初始化期间开始输入,并预编译了 V8 代码缓存,以便桌面 shell 的主进程不再在启动时从头开始重新编译。为了在对话之间实现更快的导航,编写器保持安装状态,而不是被拆除和重建,当用户将鼠标悬停在会话上时会预取会话,并且侧边栏重新渲染减少了 90%。
合并历史的规模是头条新闻:据该帖子称,在冲刺期间发生了三千多项更改,没有发生任何面向客户的事件或回滚。
Claude Tag:有护栏的特工
这次冲刺运行在 Anthropic 所称的 Claude Tag 上,该模型目前处于测试阶段,被描述为与 Opus 5.5 大致相当的内部研究模型。劳动分工是故事中最重要的部分。 Claude 发现瓶颈、构建基准、实施修复并监控每个部署 - 一次异步工作几个小时,甚至通宵。人类设定目标,做出权衡,并在合并之前批准每一项变更。
该团队还希望迭代速度快于部署节奏,因此构建了实验室测量作为实际读取的代理。工程师提出的问题包括:JavaScript 指令计数能否取代挂钟计时,作为部署前验证原型的更快反馈信号?
为什么人工智能辅助工程很重要
Anthropic 的帖子值得注意的不是具体的优化(静态 shell、预取和渲染缩减等已建立的技术),而是它展示了生产规模的人工智能驱动开发。一家前沿实验室刚刚对一款旗舰消费产品进行了 3000 处变更的性能检修,人工智能代理完成了大部分识别、实施和验证工作,而人类则保留了对每项变更的审批权。
结果还体现在竞争环境中,响应能力是产品的一项功能。 Claude 与 OpenAI 的 ChatGPT 和 Google 的 Gemini 直接竞争消费者和开发者的注意力,感知速度与模型质量一样影响着助理产品的日常使用。将交互时间从 3.1 秒缩短至 0.55 秒,解决了用户对该产品最常见的抱怨。
对于从外部观察的工程团队来说,从 Anthropic 的帐户中可以借鉴的经验教训是循环结构:精确测量用户旅程,让模型根据这些测量提出并验证更改,保留人工审批门,并仅以测量系统可以验证的速度扩展范围。 Anthropic 自己的框架是,一旦 Claude 能够测量某些东西,它就能让它变得更快——因此团队不断寻找更多的东西来测量。
类似的代理驱动冲刺是否会成为整个软件行业的标准做法还有待观察,但 Anthropic 提供了迄今为止最具体的公共数据点之一,表明它们可以大规模运行。追踪人工智能如何重塑软件开发的读者可以关注我们的人工智能研究报道,以了解进一步的发展。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →