Anthropic har publicerat en detaljerad teknisk redogörelse för hur den gjorde claude.ai och Claudes skrivbordsapp ungefär tre gånger snabbare på en tvåveckorssprint, och twisten är att det mesta av arbetet gjordes av Claude själv. Inlägget, publicerat på Anthropics ingenjörsblogg, beskriver en prestationskampanj som körs från en enda Slack-kanal med AI-modellen i varje tråd, hitta flaskhalsar, bygga riktmärken, fraktförbättringar och titta på varje implementering.
Siffrorna, mätta vid 75:e percentilen, är betydande. Tiden till en skrivbar sida på en ny laddning av claude.ai sjönk från 3,1 sekunder till 0,55 sekunder. Att starta en ny Claude Code-session sjönk från 0,8 sekunder till 0,3 sekunder, och laddningen av en Claude Cowork-molnsession minskade från 2,6 sekunder till 0,73 sekunder. Sammantaget uppskattar Anthropic att förbättringarna sparar tiotusentals användartimmar av väntan varje dag. For more context on this story, see our ongoing breaking AI news.
Mäter först, sedan rör sig
Sprinten började med mätning snarare än kod. Genom att använda Claude för att analysera användningsdata genom en Datadog MCP-server identifierade teamet de fyra användarresorna som står för 95 procent av aktiviteten: att starta appen, starta en konversation, ladda en befintlig konversation och skicka ett meddelande. Över webben och skrivbordet delade resorna upp i tretton distinkta mätningar, och teamet lade till instrumentering tills var och en var direkt jämförbar – med början vid en användarinteraktion och slutade när resultatet visades.
Med baslinjer på plats, skapade teamet en lista med ett tjugotal handplockade projekt, vart och ett inriktat på en specifik resa, och fick Claude att uppskatta effekten av vart och ett i millisekunder för att sätta sprintmål. Planen landade tidigt: Antropiska rapporter träffade tolv av de tretton målen på dag tre. Det lämnade utrymme för Claude att identifiera ytterligare möjligheter och föreslå nya arbetsflöden, som snabbt trampade in i sina egna fullständiga projekt och drev resultat bortom de ursprungliga målen.
Vad som faktiskt skickades
De tekniska förändringarna läser som en checklista över modernt webbprestandaarbete. För snabbare lanseringar bakade teamet in en statisk kompositör i HTML-koden så att användare kan börja skriva under React-initieringen, och förkompilerade en V8-kodcache så att skrivbordsskalets huvudprocess inte längre kompileras om från början vid start. För snabbare navigering mellan konversationer förblir kompositören monterad i stället för att rivas ner och byggas om, sessioner hämtas i förväg när en användare svävar över dem, och sidofältsåtergivningen minskade med 90 procent.
Omfattningen av sammanslagningshistoriken är huvudsiffran: mer än tre tusen förändringar landade under sprinten utan en enda kundinriktad incident eller rollback, enligt inlägget.
Claude Tag: en agent med skyddsräcken
Sprinten gick på vad Anthropic kallar Claude Tag, för närvarande i beta och beskrivs som en intern forskningsmodell ungefär jämförbar med Opus 5.5. Arbetsfördelningen är den mest följdriktiga delen av berättelsen. Claude hittade flaskhalsar, byggde riktmärken, implementerade korrigeringar och övervakade varje distribution – arbetade asynkront i timmar i taget, även över natten. Människor satte upp målen, gjorde avvägningar och godkände varje förändring innan den slogs samman.
Teamet ville också iterera snabbare än sin utplaceringskadens, så det byggde labbmätningar som proxyservrar för verkliga läsningar. Bland frågorna som ingenjörerna ställde: kan antalet JavaScript-instruktioner ersätta timing för väggklockor som en snabbare återkopplingssignal för validering av prototyper före implementering?
Varför det är viktigt för AI-assisterad teknik
Anthropics inlägg är mindre anmärkningsvärt för de specifika optimeringarna - statiska skal, förhämtning och renderingsreduktion är etablerade tekniker - än för vad det visar om AI-driven utveckling i produktionsskala. Ett gränslabb har just skickat en prestandaöversyn med tre tusen förändringar av en flaggskeppskonsumentprodukt med AI-agenter som sköter huvuddelen av identifierings-, implementerings- och verifieringsarbetet, medan människor behöll godkännandebefogenheter över varje förändring.
Resultatet hamnar också i en konkurrenssituation där lyhördhet är en produktfunktion. Claude konkurrerar direkt med OpenAIs ChatGPT och Googles Gemini om konsumenternas och utvecklarens uppmärksamhet, och upplevd hastighet formar den dagliga användningen av assistentprodukter lika mycket som modellkvaliteten gör. Att minska tiden till interaktiv från 3,1 sekunder till 0,55 sekunder tar itu med de enskilt vanligaste klagomålen som användarna hade om produkten.
För ingenjörsteam som tittar utifrån är den överförbara lärdomen från Anthropics konto loopstrukturen: mät användarresor exakt, låt modellen föreslå och validera ändringar mot dessa mätningar, behåll en mänsklig godkännandegrind och utöka omfattningen bara så snabbt som mätsystemet kan verifiera. Anthropics egen inramning är att när Claude kan mäta något, kan det göra det snabbare - så teamet hittade hela tiden fler saker att mäta.
Huruvida liknande agentdrivna sprints blir standardpraxis inom mjukvaruindustrin återstår att se, men Anthropic har tillhandahållit en av de mest konkreta offentliga datapunkterna hittills som de kan fungera i skala. Läsare som spårar hur AI omformar mjukvaruutveckling kan följa vår AI-forskning för vidare utveckling.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →