Anthropic opublikował w sobotę szczegółowy zestaw pomiarów, których celem jest umożliwienie społeczeństwu, dziennikarzom i rządom śledzenia, jak szybko faktycznie rozwija się pionierska sztuczna inteligencja – w tym pierwszy w swoim rodzaju wskaźnik pokazujący, ile własnych badań firmy jest obecnie prowadzonych przez sztuczną inteligencję, oraz ujawnienie, że około 30 000 agentów AI prowadzi w firmie prace badawcze i inżynieryjne w dowolnym momencie.
Post zatytułowany „Pomiary pomagające zrozumieć tempo rozwoju sztucznej inteligencji w pionierskich laboratoriach” trafia w sedno najważniejszego argumentu w branży: czy rozwój pionierskich technologii powinien być celowo spowalniany. Dario Amodei wezwał do koordynacji w celu „nadążania za granicami”, co jest propozycją, która wstrząsnęła rynkami, wyciągnęła pozew konsumencki dotyczący zmowy między głównymi laboratoriami i skłoniła prezydenta Trumpa do ogłoszenia „sił AI” zajmujących się zapobieganiem spowolnieniu. Anthropic sformułował jasno ten kontekst: „W miarę jak świat rozważa spowolnienie tempa rozwoju pionierskiej sztucznej inteligencji, społeczeństwo potrzebuje więcej informacji”.
Trzy pomiary do śledzenia postępu AI
Firma określiła trzy obszary pomiarowe, które – jej zdaniem – każde laboratorium pionierskie mogłoby regularnie publikować:
1. Jaka część prac badawczo-rozwojowych nad sztuczną inteligencją jest wykonywana przez samą sztuczną inteligencję. Firma Anthropic zbudowała prototyp „Anthropic R&D Automation Index”, katalogując każdy rodzaj prac badawczo-rozwojowych nad sztuczną inteligencją prowadzonych w firmie, oceniając stopień automatyzacji każdego zadania i agregując wyniki. Do ocen wykorzystywana jest publiczna skala „Poziomu automatyzacji” firmy Epoch AI, która rozciąga się od AL0 (brak zaangażowania sztucznej inteligencji) do AL5 (sztuczna inteligencja działa w pełni autonomicznie, bez udziału człowieka). W tej skali AL3 oznacza, że sztuczna inteligencja „współpracuje” — wykonując duże fragmenty pracy pod ścisłym kierownictwem człowieka — podczas gdy AL4 oznacza, że sztuczna inteligencja „przewodzi”, wykonując większość zadań od początku do końca na podstawie poleceń wysokiego poziomu pod nadzorem człowieka.Celem indeksu jest zmierzenie, jak blisko każde laboratorium zbliża się do rekurencyjnego samodoskonalenia — modelu w pełni autonomicznego budującego własnego następcę. Anthropic zauważa, że modele przyspieszające rozwój sztucznej inteligencji „mogą utrudnić ludziom zrozumienie i kontrolowanie tych systemów”.
2. Jak dobrze nadzorowane są działania agentów AI. Tutaj pojawia się liczba 30 000. Według stanu na sierpień 2026 r. około 30 000 agentów jednocześnie prowadziło badania i prace inżynieryjne na najczęściej używanej platformie wewnętrznej Anthropic, delegując między sobą zadania i pracując półautonomicznie przez długie okresy czasu. Firma mierzy trzy elementy nadzoru nad tymi agentami: zasięg (udział działań agentów, które przechodzą przez monitor przed wykonaniem lub po nim), opóźnienie przeglądu (jak szybko oznaczone działania są sprawdzane, najpierw przez automatyczny monitor, a następnie przez człowieka) i współczynnik eskalacji (udział działań zablokowanych, przekierowanych lub oznaczonych do przeglądu).Dotychczasowe dane monitorujące Anthropic sugerują, że poszczególni agenci rzadko zachowują się niewłaściwie, ale firma ostrzega, że „kiedy w gospodarce działają miliony lub miliardy agentów, nawet rzadkie zdarzenia mogą zdarzać się regularnie”.
3. Sposób alokacji mocy obliczeniowej. Trzeci pomiar śledzi dystrybucję zasobów obliczeniowych laboratorium — surowe dane wejściowe korelujące z możliwościami modelu. Anthropic twierdzi, że wraz z pozostałymi dwoma metrykami daje to osobom z zewnątrz możliwość skorelowania danych wejściowych modelu z wynikami modelu, uzupełniając oceny możliwości, które firma już publikuje w swoich raportach ryzyka w ramach polityki odpowiedzialnego skalowania.Liczby będą się zmieniać w przypadku spowolnienia
Najbardziej politycznie wymowny fragment postu jest skierowany bezpośrednio do tempa debaty: Anthropic stwierdza, że „spodziewałby się, że liczby te zmienią się, jeśli zapewniona zostanie koordynacja w zakresie przekraczania granic, zgodnie z wezwaniem dyrektora generalnego Anthropic Dario Amodei”. Innymi słowy, jeśli branża rzeczywiście zwolni, te wskaźniki pozwolą społeczeństwu to zweryfikować – a jeśli firmy twierdzą, że działają dynamicznie, podczas gdy ich liczba stale rośnie, pomiary również to wykażą.
Niezależna weryfikacja to brakujący element
Anthropic zdaje sobie sprawę z głównej słabości wskaźników zgłaszanych przez siebie: wykorzystuje własne modele do oceny własnych systemów, co oznacza, że model „oceniający” może mieć takie same słabe punkty jak sprawdzany model. Firma zauważa również brak wspólnej metodologii we wszystkich laboratoriach, co utrudnia porównania.
Proponowanym rozwiązaniem jest włączenie niezależnych zewnętrznych oceniających z wielu organizacji do Anthropic, zapewniając im dostęp do wewnętrznych procesów, systemów i danych porównywalnych z tym, co widzą wewnętrzne zespoły ds. oceny ryzyka. Te strony trzecie sprawdzałyby praktyki bezpieczeństwa, zgłaszały incydenty i monitorowały nowe wskaźniki. Firma twierdzi, że METR, organizacja non-profit zajmująca się oceną, już wcześniej niezależnie współpracowała z platformą monitorowania offline i planuje regularnie publikować te pomiary w formie, którą inni będą mogli zweryfikować.
Pomiary nawiązują do szerszej propozycji Anthropic Advanced AI Framework, która określa „zasady drogowe” dotyczące wypuszczania na rynek pionierskich modeli, w tym obowiązki w zakresie przejrzystości, których mogą wymagać rządy – takie jak standardowe raporty dotyczące ryzyka.
Test dla całej branży
Głębsze znaczenie stanowiska może mieć charakter konkurencyjny. Anthropic skutecznie rzuca wyzwanie każdemu laboratorium pionierskiemu opublikowanie tych samych liczb, argumentując, że „każdy pionierski programista mógłby regularnie publikować te pomiary, stosując publiczną metodologię”. Jeśli rywale ulegną upadkowi, kontrast stanie się punktem odniesienia w debacie na temat bezpieczeństwa; jeśli się zgodzą, branża uzyska pierwszy wspólny miernik rzeczywistego postępu sztucznej inteligencji.
Na razie liczby są zgłaszane samodzielnie przez firmę wyraźnie zainteresowaną rozmową. Reprezentują jednak coś, czego brakowało w debacie: konkretne, powtarzalne pomiary, które pokazałyby, czy granica przyspiesza, utrzymuje się na stałym poziomie, czy też faktycznie zwalnia.
Wyprzedź sztuczną inteligencję
Takie ujawnienia z laboratorium granicznego pojawiają się co tydzień. Aby uzyskać więcej przełomowych badań nad sztuczną inteligencją i doniesień branżowych, śledź AI Buzz Wire.
Przeczytaj najnowsze wiadomości o sztucznej inteligencji →