Firma Anthropic opublikowała szczegółowy opis inżynieryjny tego, jak w ciągu dwutygodniowego sprintu claude.ai i aplikacja komputerowa Claude przyspieszyły mniej więcej trzy razy, a różnica polega na tym, że większość pracy wykonał sam Claude. Post opublikowany na blogu inżynieryjnym Anthropic opisuje kampanię wydajnościową prowadzoną za pośrednictwem jednego kanału Slack z modelem sztucznej inteligencji w każdym wątku, znajdowanie wąskich gardeł, tworzenie testów porównawczych, ulepszenia wysyłki i obserwowanie każdego wdrożenia.

Liczby mierzone na 75. percentylu są znaczne. Czas do napisania strony po świeżym załadowaniu claude.ai spadł z 3,1 sekundy do 0,55 sekundy. Rozpoczęcie nowej sesji Claude Code spadło z 0,8 sekundy do 0,3 sekundy, a ładowanie sesji w chmurze Claude Cowork spadło z 2,6 sekundy do 0,73 sekundy. Łącznie Anthropic szacuje, że ulepszenia pozwalają zaoszczędzić dziesiątki tysięcy godzin pracy użytkowników każdego dnia. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.

Najpierw pomiar, potem ruch

Sprint rozpoczął się od pomiaru, a nie od kodu. Wykorzystując Claude do analizy danych o użytkowaniu za pośrednictwem serwera Datadog MCP, zespół zidentyfikował cztery podróże użytkownika, które odpowiadają za 95 procent aktywności: uruchomienie aplikacji, rozpoczęcie rozmowy, załadowanie istniejącej konwersacji i wysłanie wiadomości. W Internecie i na komputerach te podróże dzieliły się na trzynaście odrębnych pomiarów, a zespół dodał oprzyrządowanie, aż każdy z nich był bezpośrednio porównywalny — zaczynając od interakcji użytkownika, a kończąc na wyrenderowaniu wyniku.

Po przygotowaniu punktów bazowych zespół sporządził listę około dwudziestu starannie wybranych projektów, z których każdy dotyczył określonej podróży, i zlecił Claude'owi oszacowanie wpływu każdego z nich w milisekundach w celu ustalenia celów sprintu. Plan został zrealizowany wcześnie: raporty Anthropic osiągnęły dwanaście z trzynastu celów trzeciego dnia. To pozostawiło Claude'owi miejsce na identyfikację dalszych możliwości i zaproponowanie nowych schematów pracy, które szybko przekształciły się w pełne, własne projekty i wypchnęły wyniki poza pierwotne cele.

Co faktycznie zostało wysłane

Zmiany techniczne brzmią jak lista kontrolna dotycząca współczesnych prac nad wydajnością sieci. Aby przyspieszyć uruchamianie, zespół wgrał statyczny kompozytor do kodu HTML, aby użytkownicy mogli rozpocząć pisanie podczas inicjalizacji React, i wstępnie skompilował pamięć podręczną kodu V8, aby główny proces powłoki pulpitu nie kompilował się już od zera przy uruchomieniu. Aby przyspieszyć nawigację między rozmowami, kompozytor pozostaje zamontowany, a nie rozbierany i odbudowywany, sesje są pobierane z wyprzedzeniem, gdy użytkownik najedzie na nie kursorem, a ponowne renderowanie paska bocznego zostało skrócone o 90 procent.

Najważniejsza jest skala historii fuzji: zgodnie z postem w trakcie sprintu wprowadzono ponad trzy tysiące zmian bez ani jednego zdarzenia związanego z kontaktem z klientem lub wycofania zmian.

Claude Tag: agent z barierkami

Sprint opierał się na tym, co Anthropic nazywa Claude Tagiem, obecnie w fazie beta i opisanym jako wewnętrzny model badawczy z grubsza porównywalny z Opus 5.5. Podział pracy jest najważniejszą częścią tej historii. Claude znajdował wąskie gardła, tworzył testy porównawcze, wdrażał poprawki i monitorował każde wdrożenie — pracując asynchronicznie przez wiele godzin, a nawet przez noc. Ludzie wyznaczali cele, dokonywali kompromisów i zatwierdzali każdą zmianę, zanim się połączyła.

Zespół chciał także wykonywać iteracje szybciej niż częstotliwość wdrażania, dlatego stworzył pomiary laboratoryjne jako zastępcze odczyty w świecie rzeczywistym. Wśród pytań zadanych przez inżynierów było: czy zliczanie instrukcji JavaScript może zastąpić taktowanie zegara ściennego jako szybszy sygnał zwrotny umożliwiający walidację prototypów przed wdrożeniem?

Dlaczego jest to ważne w inżynierii wspomaganej sztuczną inteligencją

Post Anthropic jest godny uwagi nie tyle ze względu na konkretne optymalizacje — powłoki statyczne, pobieranie z wyprzedzeniem i redukcja renderowania to ustalone techniki, ile na to, co pokazuje na temat rozwoju opartego na sztucznej inteligencji na skalę produkcyjną. Pograniczne laboratorium właśnie dostarczyło przegląd wydajności trzech tysięcy zmian flagowego produktu konsumenckiego, przy czym agenci sztucznej inteligencji wykonują większość prac związanych z identyfikacją, wdrażaniem i weryfikacją, podczas gdy ludzie zachowują władzę zatwierdzania każdej zmiany.

Wynik trafia również w kontekst konkurencyjny, w którym responsywność jest cechą produktu. Claude bezpośrednio konkuruje z ChatGPT OpenAI i Gemini firmy Google o uwagę konsumentów i programistów, a postrzegana prędkość wpływa na codzienne korzystanie z produktów asystentów w takim samym stopniu, jak jakość modelu. Skrócenie czasu do uzyskania interakcji z 3,1 sekundy do 0,55 sekundy rozwiązuje najczęstszą skargę użytkowników dotyczącą produktu.

Dla zespołów inżynierskich obserwujących z zewnątrz lekcją, którą można przenieść z konta Anthropic, jest struktura pętli: precyzyjnie mierz podróże użytkowników, pozwól modelowi zaproponować i zweryfikować zmiany na podstawie tych pomiarów, prowadź bramkę zatwierdzającą przez człowieka i rozszerzaj zakres tylko tak szybko, jak może to zweryfikować system pomiarowy. Anthropic opiera się na założeniu, że gdy Claude może coś zmierzyć, może to zrobić szybciej, więc zespół ciągle znajdował więcej rzeczy do zmierzenia.

Czas pokaże, czy podobne sprinty oparte na agentach staną się standardową praktyką w branży oprogramowania, ale firma Anthropic dostarczyła jeden z najbardziej konkretnych publicznych punktów danych, jaki dotąd można było zastosować na dużą skalę. Czytelnicy śledzący, jak sztuczna inteligencja zmienia rozwój oprogramowania, mogą śledzić nasze badania nad sztuczną inteligencją w celu uzyskania dalszych informacji.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →