Anthropic hat einen detaillierten technischen Bericht darüber veröffentlicht, wie claude.ai und die Claude-Desktop-App in einem zweiwöchigen Sprint etwa dreimal schneller gemacht wurden, und der Clou ist, dass der Großteil der Arbeit von Claude selbst erledigt wurde. Der im Engineering-Blog von Anthropic veröffentlichte Beitrag beschreibt eine Leistungskampagne, die über einen einzelnen Slack-Kanal mit dem KI-Modell in jedem Thread ausgeführt wird, Engpässe findet, Benchmarks erstellt, Verbesserungen ausliefert und jede Bereitstellung beobachtet.

Die Zahlen, gemessen am 75. Perzentil, sind beträchtlich. Die Zeit bis zur Erstellung einer typisierbaren Seite bei einem neuen Ladevorgang von claude.ai sank von 3,1 Sekunden auf 0,55 Sekunden. Das Starten einer neuen Claude Code-Sitzung sank von 0,8 Sekunden auf 0,3 Sekunden und das Laden einer Claude Cowork-Cloud-Sitzung sank von 2,6 Sekunden auf 0,73 Sekunden. Insgesamt schätzt Anthropic, dass die Verbesserungen jeden Tag Zehntausende Benutzerstunden an Wartezeit einsparen. Weitere Informationen zu dieser Geschichte finden Sie in unserer aktuelle KI-Trends.

Erst messen, dann bewegen

Der Sprint begann mit Messungen statt mit Code. Mithilfe von Claude zur Analyse von Nutzungsdaten über einen Datadog MCP-Server identifizierte das Team die vier Benutzerreisen, die 95 Prozent der Aktivität ausmachen: Starten der App, Starten einer Konversation, Laden einer vorhandenen Konversation und Senden einer Nachricht. Über Web und Desktop hinweg wurden diese Reisen in dreizehn verschiedene Messungen unterteilt, und das Team fügte Instrumentierung hinzu, bis jede direkt vergleichbar war – beginnend mit einer Benutzerinteraktion und endend, sobald das Ergebnis gerendert wurde.

Nachdem die Grundlinien festgelegt waren, erstellte das Team eine Liste mit etwa zwanzig handverlesenen Projekten, von denen jedes auf eine bestimmte Reise abzielte, und ließ Claude die Auswirkungen jedes einzelnen in Millisekunden abschätzen, um Sprintziele festzulegen. Der Plan ging früh auf: Anthropic meldete, am dritten Tag zwölf der dreizehn Ziele erreicht zu haben. Dies ließ Claude Raum, weitere Möglichkeiten zu identifizieren und neue Arbeitsabläufe vorzuschlagen, die schnell zu vollständigen eigenen Projekten führten und die Ergebnisse über die ursprünglichen Ziele hinaus steigerten.

Was tatsächlich versendet wurde

Die technischen Änderungen lesen sich wie eine Checkliste moderner Web-Performance-Arbeit. Für schnellere Starts hat das Team einen statischen Composer in den HTML-Code integriert, damit Benutzer während der React-Initialisierung mit der Eingabe beginnen können, und einen V8-Code-Cache vorkompiliert, sodass der Hauptprozess der Desktop-Shell beim Start nicht mehr von Grund auf neu kompiliert wird. Für eine schnellere Navigation zwischen Konversationen bleibt der Composer gemountet, anstatt abgerissen und neu erstellt zu werden. Sitzungen werden vorab abgerufen, wenn ein Benutzer mit der Maus darüber fährt, und Neu-Renderings in der Seitenleiste wurden um 90 Prozent reduziert.

Der Umfang des Merge-Verlaufs ist die Schlagzeile: Laut dem Beitrag wurden während des Sprints mehr als dreitausend Änderungen vorgenommen, ohne dass es zu einem einzigen Vorfall oder Rollback mit Kundenkontakt kam.

Claude Tag: ein Agent mit Leitplanken

Der Sprint lief auf dem von Anthropic genannten Claude Tag, das sich derzeit in der Betaphase befindet und als internes Forschungsmodell beschrieben wird, das in etwa mit Opus 5.5 vergleichbar ist. Die Arbeitsteilung ist der folgenreichste Teil der Geschichte. Claude fand Engpässe, erstellte Benchmarks, implementierte Korrekturen und überwachte jede Bereitstellung – er arbeitete stundenlang, sogar über Nacht, asynchron. Menschen legten die Ziele fest, gingen Kompromisse ein und genehmigten jede Änderung, bevor sie in Kraft trat.

Das Team wollte außerdem schneller iterieren als im Bereitstellungsrhythmus, also erstellte es Labormessungen als Proxys für reale Lesevorgänge. Zu den Fragen, die die Ingenieure stellten, gehörten: Könnte die Anzahl der JavaScript-Anweisungen die Zeitmessung im Zeittakt als schnelleres Feedbacksignal für die Validierung von Prototypen vor der Bereitstellung ersetzen?

Warum es für KI-gestütztes Engineering wichtig ist

Der Beitrag von Anthropic zeichnet sich weniger durch die spezifischen Optimierungen aus – statische Shells, Prefetching und Render-Reduktion sind etablierte Techniken – als durch das, was er über KI-gesteuerte Entwicklung im Produktionsmaßstab demonstriert. Ein Grenzlabor hat gerade eine Leistungsüberarbeitung eines Flaggschiff-Verbraucherprodukts mit dreitausend Änderungen durchgeführt, wobei KI-Agenten den Großteil der Identifikations-, Implementierungs- und Verifizierungsarbeit übernehmen, während der Mensch die Genehmigungshoheit über jede Änderung behält.

Das Ergebnis landet auch in einem Wettbewerbsumfeld, in dem Reaktionsfähigkeit ein Produktmerkmal ist. Claude konkurriert direkt mit ChatGPT von OpenAI und Gemini von Google um die Aufmerksamkeit von Verbrauchern und Entwicklern, und die wahrgenommene Geschwindigkeit beeinflusst die tägliche Nutzung von Assistenzprodukten ebenso wie die Modellqualität. Durch die Verkürzung der Zeit bis zur Interaktion von 3,1 Sekunden auf 0,55 Sekunden wird die häufigste Beschwerde der Benutzer über das Produkt behoben.

Für Ingenieurteams, die von außen zuschauen, ist die übertragbare Lektion aus Anthropics Bericht die Schleifenstruktur: Messen Sie Benutzerreisen präzise, ​​lassen Sie das Modell Änderungen vorschlagen und anhand dieser Messungen validieren, behalten Sie ein menschliches Genehmigungstor bei und erweitern Sie den Umfang nur so schnell, wie das Messsystem dies überprüfen kann. Anthropic geht davon aus, dass Claude, sobald er etwas messen kann, es schneller machen kann – also fand das Team immer mehr Dinge zum Messen.

Ob ähnliche agentengesteuerte Sprints in der gesamten Softwarebranche zur Standardpraxis werden, bleibt abzuwarten, aber Anthropic hat einen der bisher konkretesten öffentlichen Datenpunkte bereitgestellt, die in großem Maßstab funktionieren können. Leser, die verfolgen, wie KI die Softwareentwicklung verändert, können unsere KI-Forschungsberichterstattung für weitere Entwicklungen verfolgen.

---

Bleib vorne bei KI

Die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Mehr KI-Nachrichten lesen →