Anthropic は、claude.ai と Claude デスクトップ アプリを 2 週間のスプリントでどのようにして約 3 倍高速化したかに関する詳細なエンジニアリング アカウントを公開しました。さらに、作業のほとんどが Claude 自身によって行われたという点が特徴です。 Anthropic のエンジニアリング ブログで公開されたこの投稿では、すべてのスレッドで AI モデルを使用して単一の Slack チャネルからパフォーマンス キャンペーンを実行し、ボトルネックを発見し、ベンチマークを構築し、改善を出荷し、すべてのデプロイを監視する方法について説明しています。

75 パーセンタイルで測定されるこの数値は、相当なものです。 claude.ai を新たにロードしたときに入力可能なページが表示されるまでの時間は、3.1 秒から 0.55 秒に短縮されました。新しい Claude Code セッションの開始は 0.8 秒から 0.3 秒に短縮され、Claude Cowork クラウド セッションの読み込みは 2.6 秒から 0.73 秒に短縮されました。 Anthropic 社は、これらの改善により、毎日何万時間ものユーザーの待ち時間が節約されると見積もっています。 この件の詳細は、AIの最新動向をご覧ください。

最初に測定してから移動

スプリントはコードではなく測定から始まりました。 Claude を使用して Datadog MCP サーバーを通じて使用状況データを分析したところ、チームはアクティビティの 95% を占める 4 つのユーザー ジャーニー (アプリの起動、会話の開始、既存の会話の読み込み、メッセージの送信) を特定しました。ウェブとデスクトップにわたるこれらのジャーニーは 13 の異なる測定に分類され、チームはそれぞれが直接比較できるようになるまで計測を追加しました。ユーザー インタラクションから始まり、結果がレンダリングされた時点で終了します。

ベースラインを設定した後、チームは、それぞれが特定のジャーニーを対象とした約 20 個の厳選されたプロジェクトのリストを作成し、クロードに各プロジェクトの影響をミリ秒単位で推定してスプリント目標を設定させました。計画は早期に成功し、Anthropic は 3 日目までに 13 の目標のうち 12 を達成したと報告しています。そのため、クロードにはさらなる機会を特定し、新しいワークストリームを提案する余地が残され、すぐに独自の完全なプロジェクトに着手し、当初の目標を超える結果をもたらしました。

実際に発送されたもの

技術的な変更は、現代の Web パフォーマンス作業のチェックリストのようなものです。起動を高速化するために、チームは静的コンポーザーを HTML に焼き付けて、ユーザーが React の初期化中に入力を開始できるようにしました。また、デスクトップ シェルのメイン プロセスが起動時に最初から再コンパイルされないよう V8 コード キャッシュをプリコンパイルしました。会話間のナビゲーションを高速化するために、コンポーザーは取り壊されて再構築されるのではなくマウントされたままになり、ユーザーがセッションの上にマウスを移動するとセッションがプリフェッチされ、サイドバーの再レンダリングが 90% 削減されました。

投稿によると、マージ履歴の規模は見出しの数字であり、顧客対応のインシデントやロールバックが一度も発生することなく、スプリント中に 3,000 を超える変更が反映されたとのことです。

クロード タグ: ガードレールのあるエージェント

このスプリントは、Anthropic が Claude Tag と呼ぶもので実行されました。これは現在ベータ版であり、Opus 5.5 にほぼ匹敵する内部研究モデルであると説明されています。分業はこの話の最も重要な部分です。クロードはボトルネックを発見し、ベンチマークを構築し、修正を実装し、すべてのデプロイメントを監視し、一度に数時間、場合によっては一晩中非同期的に作業しました。人間が目標を設定し、トレードオフを行い、すべての変更を統合する前に承認しました。

チームはまた、デプロイの頻度よりも速く反復することを望んでいたため、現実世界の読み取りのプロキシとしてラボの測定値を構築しました。エンジニアが尋ねた質問の中には、展開前にプロトタイプを検証するためのより高速なフィードバック信号として、JavaScript 命令カウントが実時間のタイミングに取って代わることはできるでしょうか?

AI 支援エンジニアリングにとって重要な理由

Anthropic の投稿は、特定の最適化 (静的シェル、プリフェッチ、レンダー リダクションは確立された技術です) よりも、実稼働規模での AI 主導の開発について示している点で注目に値します。フロンティア ラボでは、主要な消費者製品の 3,000 件の変更によるパフォーマンスのオーバーホールを出荷したところです。AI エージェントが識別、実装、検証の作業の大部分を行う一方、人間はすべての変更に対する承認権限を保持していました。

その結果、応答性が製品の機能となる競争環境にも影響を及ぼします。クロードは、消費者や開発者の注目を集めるために OpenAI の ChatGPT や Google の Gemini と直接競合しており、モデルの品質と同様に、知覚される速度がアシスタント製品の日常的な使用法を左右します。インタラクティブになるまでの時間を 3.1 秒から 0.55 秒に短縮することで、ユーザーが製品に関して抱いていた最も一般的な唯一の不満に対処しました。

外部から見ているエンジニアリング チームにとって、Anthropic の説明から得られる教訓は、ループ構造です。つまり、ユーザー ジャーニーを正確に測定し、モデルにそれらの測定に対する変更を提案および検証させ、人間による承認ゲートを維持し、測定システムが検証できる速度でのみ範囲を拡大します。 Anthropic 独自の枠組みでは、クロードが何かを測定できれば、それをより速くできるということです。そのため、チームは測定すべきものをさらに探し続けました。

同様のエージェント主導のスプリントがソフトウェア業界全体で標準的な慣行となるかどうかはまだわかりませんが、Anthropic は大規模に機能する、これまでで最も具体的な公開データ ポイントの 1 つを提供しました。 AI がソフトウェア開発をどのように再構築しているかを追跡している読者は、AI 研究の報道を追跡してさらなる開発を進めることができます。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →