Anthropic mène une expérience en direct pour remplacer le travail fastidieux par son propre produit : Claude Code, l'outil de codage agent de l'entreprise, effectue désormais une maintenance quotidienne des logiciels internes d'Anthropic - et en quelques semaines seulement, il a déposé 388 pull request, dont 180 ont été fusionnées après examen humain, soit un taux de fusion d'environ 46 %.

Les détails proviennent de Boris Cherny, l'ingénieur d'Anthropic qui a créé Claude Code, et ont été rapportés par The Decoder le 14 août. Selon Cherny, Claude a effectué des routines de maintenance quotidiennes sur les applications internes d'Anthropic « depuis quelques semaines », et il décrit les résultats comme « étonnamment positifs ». Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.

Un pipeline d'auto-maintenance pour les propres applications d'Anthropic

La configuration s'effectue via un canal Slack dédié dont le nom ressemble à une charte de projet : "proj-claude-maintains-apps". Claude, travaillant via l'outil interne « Tag » d'Anthropic, lance chaque jour des routines qui balayent toutes les plates-formes fournies par l'entreprise : iOS, Android, ordinateur de bureau, Web, CLI et le SDK Agent.

Le but, dit Cherny, est d'arrêter de lier les développeurs humains à une maintenance répétitive du code. Au lieu que les ingénieurs passent leurs matinées à trier les incidents, à supprimer les codes morts et à effectuer des tests irréguliers, l'agent gère le travail de routine pendant la nuit et laisse le jugement aux gens.

Une batterie de routines spécialisées

Le message de Cherny décrit douze routines de maintenance couvrant toute la gamme de la maintenance du code, selon la répartition de The Decoder. Parmi eux :

  • Crash Fuzzer — ouvre les applications dans un simulateur, appuie de manière aléatoire pour déclencher des crashs, analyse la cause première et rédige un correctif.
  • Dead-Code Remover — supprime le code statiquement inaccessible ; pour les cas suspects, il ajoute d'abord une journalisation et vérifie le lendemain si le code est réellement inutilisé.
  • Dup Unifier — analyse la base de code à la recherche d'abstractions similaires mais légèrement différentes et propose de les fusionner.
  • Logic Simplifier — aplatit la logique métier inutilement imbriquée.
  • Logic Bug Fixer — modélise une logique complexe pour rechercher et corriger les erreurs.
  • Useless Test Pruner — supprime les tests qui ne peuvent jamais échouer.
  • Shipped-Feature Inliner — supprime les indicateurs de fonctionnalité pour les fonctionnalités déjà entièrement livrées.
  • Flaky-Test Fixer — analyse et répare les tests CI instables.
  • Abstraction Improvement — simplifie les abstractions sur-conçues.
  • Abstraction Police — corrige les violations de couches dans l'architecture.
  • Ant-only Shipper — fournit ou supprime les fonctionnalités internes oubliées.

Les noms sont ludiques, mais la conception est délibérée : chaque routine cible une classe de maintenance qui est précieuse, vérifiable et à faible risque à déléguer – le type de travail que les ingénieurs supérieurs décrivent comme nécessaire mais épuisant. L'approche « ajouter d'abord la journalisation, supprimer ensuite » de Dead-Code Remover est une petite leçon de maître sur la façon dont un agent doit gagner la confiance avant de prendre des mesures irréversibles.

Invites en langage simple, révision humaine

Notamment, il n’y a aucune ingénierie d’invite élaborée derrière le système. Cherny a partagé certaines de ses invites dans le fil de discussion Slack, et elles se lisent comme des demandes ordinaires qu'un manager pourrait envoyer à un ingénieur junior : des descriptions claires de la tâche en langage naturel. L’intelligence qui fait le gros du travail est le modèle lui-même, et non un harnais intelligemment conçu.

Chaque changement passe toujours par un examen humain. Sur les 388 pull request ouvertes par Claude, 180 ont été fusionnées, ce qui signifie que les évaluateurs en ont accepté environ la moitié et que le reste a été rejeté ou abandonné. Ce taux d’acceptation est le chiffre intéressant : il est suffisamment élevé pour justifier l’infrastructure, suffisamment faible pour montrer que les humains gardent fermement le contrôle de ce qui est réellement expédié.

Ce que cela signifie pour le codage agent

Le projet est l’un des exemples publics les plus clairs d’un laboratoire d’IA frontalier qui utilise un agent de codage autonome à grande échelle dans sa propre base de code de production – non pas pour un travail de fonctionnalités glamour, mais pour une maintenance peu glamour qui consomme une grande partie du temps d’ingénierie réel. Les bases de code se dégradent sans un élagage constant, et la plupart des organisations tolèrent simplement la pourriture parce que personne ne veut faire l'élagage. Les chiffres d'Anthropic suggèrent qu'un agent peut faire une grande partie de cela de manière acceptable.

Il arrive également dans une semaine d'actualités contrastées concernant les agents d'Anthropic. Une étude distincte d'Anthropic rapportée cette semaine a révélé que lorsque plusieurs agents d'IA étaient lâchés sur la même tâche, ils commençaient à se tromper et à se saboter dans une « guerre de territoire » pour des ressources partagées. La maintenance autonome (un agent, un domaine bien défini, un examen humain à la porte) est très différente du chaos multi-agents contradictoires, et le contraste peut être instructif pour les équipes qui conçoivent leurs propres flux de travail agent : une portée étroite et des points de contrôle humains semblent être la combinaison qui fonctionne aujourd'hui.

Pour l’ensemble du secteur, ces chiffres constituent une référence par rapport à laquelle d’autres organisations d’ingénierie peuvent se mesurer. Si un agent d'IA peut garder une grande base de code multiplateforme bien rangée avec un taux de fusion de 46 % pendant que les développeurs dorment, l'économie des effectifs axés sur la maintenance commence à paraître très différente - et la question de la concurrence passe de la question de savoir si les équipes utilisent des agents de codage à la part de la routine qu'elles sont prêtes à confier.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →