Anthropic kör ett liveexperiment med att ersätta grunt-arbete med sin egen produkt: Claude Code, företagets agentkodningsverktyg, utför nu dagligt underhåll av Anthropics interna programvara – och på bara några veckor har det lämnat in 388 pull-förfrågningar, varav 180 slogs samman efter mänsklig granskning, en sammanslagningsgrad på ungefär 46 procent.
Detaljerna kommer från Boris Cherny, den antropiska ingenjören som skapade Claude Code, och rapporterades av The Decoder den 14 augusti. Enligt Cherny har Claude kört dagliga underhållsrutiner på Anthropics interna appar "under de senaste veckorna", och han beskriver resultaten som "förvånansvärt positiva". For more context on this story, see our ongoing breaking AI news.
En självunderhållspipeline för Anthropics egna appar
Installationen går genom en dedikerad Slack-kanal med ett namn som lyder som en projektstadga: "proj-claude-underhåller-appar." Claude, som arbetar genom Anthropics interna "Tag"-verktyg, startar rutiner varje dag som sveper över alla plattformar som företaget levererar – iOS, Android, desktop, webb, CLI och Agent SDK.
Poängen, säger Cherny, är att sluta binda upp mänskliga utvecklare med repetitivt underhåll av kod. Istället för att ingenjörer spenderar sina morgnar på krocktriage, borttagning av döda koder och fläckiga tester, sköter agenten det rutinmässiga arbetet över natten och lämnar bedömningssamtal till folk.
Ett batteri av specialiserade rutiner
Chernys inlägg beskriver tolv underhållsrutiner som täcker hela utbudet av kodunderhåll, enligt The Decoders uppdelning. Bland dem:
- Crash Fuzzer — öppnar apparna i en simulator, knackar runt slumpmässigt för att utlösa krascher, analyserar grundorsaken och utarbetar en lösning.
- Dead-Code Remover — tar bort statiskt oåtkomlig kod; för misstänkta fall lägger den först till loggning och kontrollerar nästa dag om koden verkligen är oanvänd.
- Dup Unifier — skannar kodbasen efter liknande-men-något olika abstraktioner och föreslår sammanslagning av dem.
- Logic Simplifier — plattar ut onödigt kapslad affärslogik.
- Logic Bug Fixer — modellerar komplex logik för att hitta och åtgärda fel.
- Useless Test Pruner — tar bort tester som aldrig kan misslyckas.
- Shipped-Feature Inliner — tar bort funktionsflaggor för funktioner som redan har levererats helt.
- Flaky-Test Fixer — analyserar och reparerar instabila CI-tester.
- Abstraktionsförbättrare — förenklar överkonstruerade abstraktioner.
- Abstraktionspolisen — fixar lageröverträdelser i arkitekturen.
- Ant-only Shipper — levererar eller tar bort bortglömda interna funktioner.
Namnen är lekfulla, men designen är avsiktlig: varje rutin riktar sig mot en klass av underhåll som är värdefullt, verifierbart och med låg risk att delegera - den typ av arbete som senior ingenjörer beskriver som nödvändigt men själsdränerande. Dead-Code Removers tillvägagångssätt "lägg till loggning först, ta bort andra" är en liten mästarklass i hur en agent ska förtjäna förtroende innan de vidtar oåterkalleliga åtgärder.
Vanliga uppmaningar, mänsklig granskning
Noterbart är att det inte finns någon utarbetad snabbteknik bakom systemet. Cherny delade med sig av några av sina uppmaningar i Slack-tråden, och de läser som vanliga förfrågningar som en chef kan skicka till en yngre ingenjör - enkla beskrivningar av uppgiften på naturligt språk. Intelligensen som gör de tunga lyften är själva modellen, inte en smart konstruerad sele.
Varje förändring passerar fortfarande genom mänsklig granskning. Av de 388 pull-förfrågningar som Claude öppnade slogs 180 samman – vilket innebär att granskare accepterade ungefär hälften, och resten avvisades eller övergavs. Den acceptansgraden är den intressanta siffran: den är tillräckligt hög för att motivera infrastrukturen, tillräckligt låg för att visa att människor fortfarande har fast kontroll över vad som faktiskt skickas.
Vad det signalerar för agentkodning
Projektet är ett av de tydligaste offentliga exemplen på ett frontier AI-labb som testar en autonom kodningsagent i stor skala i sin egen produktionskodbas – inte för glamoröst funktionsarbete, utan för det oglamorösa underhållet som tar en stor del av verklig ingenjörstid. Kodbaser förfaller utan konstant beskärning, och de flesta organisationer tolererar helt enkelt rötan eftersom ingen vill göra beskärningen. Anthropics siffror tyder på att en agent kan göra mycket av det acceptabelt.
Det landar också i en vecka med kontrasterande nyheter om Anthropics agenter. Separat antropisk forskning som rapporterades denna vecka fann att när flera AI-agenter släpptes lösa på samma uppgift började de lura och sabotera varandra i ett "torvkrig" om delade resurser. Autonomt underhåll – en agent, en välavgränsad domän, mänsklig granskning vid porten – ser väldigt annorlunda ut från kaos med flera agenter, och kontrasten kan vara lärorik för team som utformar sina egna agentarbetsflöden: snäva omfattning plus mänskliga kontrollpunkter verkar vara den kombination som fungerar idag.
För den bredare industrin sätter siffrorna ett riktmärke som andra ingenjörsorganisationer kan mäta sig mot. Om en AI-agent kan hålla ordning på en stor kodbas med flera plattformar med en sammanslagningshastighet på 46 procent medan utvecklare sover, börjar ekonomin med underhållsdrivet antal anställda se väldigt annorlunda ut – och konkurrensfrågan skiftar från om team använder kodningsagenter till hur mycket av rutinen de är villiga att lämna över.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →