Anthropic は、単調な作業を自社製品に置き換えるライブ実験を行っています。同社のエージェント コーディング ツールである Claude Code は現在、Anthropic の内部ソフトウェアの毎日のメンテナンスを行っています。そして、わずか数週間で 388 件のプル リクエストが提出され、そのうち 180 件が人間のレビュー後にマージされ、マージ率は約 46% です。

詳細は、Claude Codeを作成したAnthropicのエンジニアであるBoris Cherny氏から得られ、8月14日にThe Decoderが報じた。Cherny氏によると、Claude氏は「ここ数週間」Anthropicの社内アプリで毎日のメンテナンスルーチンを実行しており、その結果は「驚くほど良好」だったと述べている。 この件の詳細は、AIの最新動向をご覧ください。

Anthropic 独自のアプリのセルフメンテナンス パイプライン

セットアップは、プロジェクト憲章のような名前「proj-claude-maintains-apps」を持つ専用の Slack チャネルを通じて実行されます。 Claude は、Anthropic の内部「タグ」ツールを使用して、iOS、Android、デスクトップ、Web、CLI、エージェント SDK など、同社が出荷するすべてのプラットフォームを網羅するルーチンを毎日開始します。

重要なのは、人間の開発者を反復的なコードの維持に拘束するのをやめることだと、Cherny 氏は言います。エンジニアが午前中をクラッシュのトリアージ、デッドコードの削除、不安定なテストに費やす代わりに、エージェントはルーチンワークを夜通しで処理し、判断は人々に任せます。

一連の特殊なルーチン

The Decoder の内訳によると、Cherny 氏の投稿には、コード維持の全範囲をカバーする 12 のメンテナンス ルーチンが記載されています。その中には:

  • クラッシュ ファザー — シミュレーターでアプリを開き、ランダムにタップしてクラッシュを引き起こし、根本原因を分析して修正案を作成します。
  • デッドコード リムーバー — 静的に到達できないコードを削除します。疑わしいケースの場合は、まずログを追加し、翌日そのコードが本当に未使用であるかどうかをチェックします。
  • Dup Unifier — コードベースをスキャンして、似ているがわずかに異なる抽象化を探し、それらをマージすることを提案します。
  • Logic Simplifier — 不必要にネストされたビジネス ロジックを平坦化します。
  • Logic Bug Fixer — エラーを見つけて修正するために複雑なロジックをモデル化します。
  • 役に立たないテスト プルーナー — 絶対に失敗しないテストを削除します。
  • 出荷済み機能インライナー — すでに完全に出荷されている機能の機能フラグを削除します。
  • Flaky-Test Fixer — 不安定な CI テストを分析および修復します。
  • 抽象化改善者 — 過剰に設計された抽象化を簡素化します。
  • 抽象化警察 — アーキテクチャ内のレイヤー違反を修正します。
  • Ant-only シッパー — 忘れられた内部機能を提供または削除します。

名前には遊び心がありますが、設計は意図的です。各ルーチンは、価値があり、検証可能で、委任するリスクが低いメンテナンスのクラスを対象としています。これは、上級エンジニアが必要だが魂を消耗する作業であると上級エンジニアが表現する種類の作業です。 Dead-Code Remover の「最初にログを追加し、次に削除」アプローチは、エージェントが取り消し不能なアクションを実行する前に信頼を獲得する方法についての小さなマスタークラスです。

わかりやすい言葉でのプロンプト、人間によるレビュー

注目すべきは、システムの背後に精緻な即時エンジニアリングが存在しないことです。 Cherny 氏は Slack スレッドでプロンプトの一部を共有しましたが、それらはマネージャーが若手エンジニアに送信するような通常のリクエストのようなもので、自然言語でタスクを簡単に説明したものでした。力仕事を行うインテリジェンスはモデルそのものであり、巧妙に設計されたハーネスではありません。

すべての変更は依然として人間によるレビューを経ています。クロードがオープンした 388 件のプル リクエストのうち、180 件がマージされました。つまり、レビュー担当者は約半分を受け入れ、残りは拒否または放棄されました。この受け入れ率は興味深い数字です。インフラストラクチャを正当化するには十分に高いですが、実際に出荷するものを人間がしっかりと管理していることを示すには十分に低いです。

エージェントコーディングのシグナル内容

このプロジェクトは、フロンティア AI ラボが独自の実稼働コードベース内で自律型コーディング エージェントを大規模にドッグフーディングしている、最も明白な公開例の 1 つです。これは、魅力的な機能作業のためではなく、実際のエンジニアリング時間の大部分を消費する地味なメンテナンスのためです。継続的なプルーニングを行わないとコードベースは腐敗し、誰もプルーニングをやりたがらないため、ほとんどの組織は単に腐敗を容認します。 Anthropic の数字は、エージェントが多くのことを許容できる範囲で実行できることを示唆しています。

また、Anthropic のエージェントに関する対照的なニュースが続く 1 週間にも登場します。今週報告された別の人類研究では、複数のAIエージェントが同じタスクに放たれると、共有リソースをめぐる「縄張り争い」で互いに騙し合い、妨害し始めることが判明した。自律型メンテナンス (1 つのエージェント、1 つの適切な範囲のドメイン、ゲートでの人間によるレビュー) は、敵対的なマルチエージェントの混乱とは大きく異なります。そのコントラストは、独自のエージェント ワークフローを設計しているチームにとって有益になる可能性があります。狭い範囲と人間によるチェックポイントの組み合わせが、現在機能しているようです。

より広範な業界にとって、この数値は他のエンジニアリング組織が測定できるベンチマークとなります。開発者が寝ている間に AI エージェントが大規模なマルチプラットフォームのコードベースを 46% のマージ率で整然とした状態に保つことができれば、メンテナンス主導の人員数の経済性は大きく変わり始めます。競争上の疑問は、チームがコーディング エージェントを使用するかどうかから、ルーチンをどれだけ引き継ぎたいかという問題に移ります。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →