Anthropic publicerade en detaljerad uppsättning självmätningar på lördagen avsedda att låta allmänheten, journalister och regeringar spåra hur snabbt frontier AI faktiskt utvecklas - inklusive ett första i sitt slag index över hur mycket av företagets egen forskning som nu utförs av AI, och avslöjandet att ungefär 30 000 AI-agenter gör forskning och ingenjörsarbete inom företaget vid varje givet tillfälle.

Inlägget, med titeln "Mätningar för att förstå takten i AI-utvecklingen i gränslaboratorier", kommer till centrum för det mest följdriktiga argumentet i branschen: om gränsutvecklingen medvetet bör bromsas upp. Dario Amodei har krävt samordning för att "tempa gränsen", ett förslag som har skakat marknader, dragit fram en konsumentprocess med påstående om pacing-samverkan mellan stora laboratorier, och fått president Trump att tillkännage en "AI Force" dedikerad till att förhindra all avmattning. Anthropics inramning är tydlig om det sammanhanget: "När världen överväger att sakta ner takten i frontier AI-utveckling, behöver allmänheten mer information."

Tre mätningar för att spåra AI-framsteg

Företaget lade ut tre mätområden som det hävdar att alla gränslaboratorier skulle kunna publicera regelbundet:

1. Hur mycket av AI R&D utförs av AI själv. Anthropic byggde en prototyp av "Anthropic R&D Automation Index" genom att katalogisera alla typer av AI-forskning och utvecklingsarbete som utförs på företaget, betygsätta hur automatiserad varje uppgift för närvarande är och aggregera resultaten. Betygen använder Epoch AI:s offentliga "Automation Level"-skala, som går från AL0 (ingen AI-inblandning) till AL5 (AI fungerar helt autonomt utan någon människa i slingan). På den här skalan betyder AL3 att AI "samarbetar" - gör stora bitar av arbete under nära mänsklig ledning - medan AL4 betyder AI "ledar", och slutför det mesta av en uppgift från början från en högnivåprompt medan en människa övervakar.

Poängen med indexet är att mäta hur nära ett labb närmar sig rekursiv självförbättring - en modell som helt autonomt bygger sin egen efterträdare. Anthropic noterar att modeller som accelererar AI-utveckling "kan göra det mer utmanande för människor att förstå eller kontrollera dessa system."

2. Hur väl övervakas AI-agenters agerande. Det är här siffran 30 000 visas. I augusti 2026 utförde cirka 30 000 agenter forsknings- och ingenjörsarbete vid något tillfälle inom Anthropics mest använda interna plattform, delegerade uppgifter till varandra och arbetade semi-autonomt under långa sträckor. Företaget mäter tre saker om tillsyn av dessa agenter: täckning (andelen agentåtgärder som passerar en monitor före eller efter exekvering), granskningsfördröjning (hur snabbt flaggade åtgärder granskas, först av en automatiserad monitor och sedan av en människa) och eskaleringshastighet (andelen av aktiviteter som blockeras, omdirigeras eller flaggas för granskning).

Anthropics övervakningsdata hittills tyder på att enskilda agenter sällan beter sig fel - men företaget varnar för att "när det finns miljoner eller miljarder agenter som verkar i ekonomin kan till och med sällsynta händelser inträffa regelbundet."

3. Hur beräkningen allokeras. Den tredje mätningen spårar hur labbets beräkningsresurser är fördelade – den råa indata som korrelerar med modellens kapacitet. Tillsammans med de andra två mätvärdena hävdar Anthropic att detta ger utomstående ett sätt att korrelera modellindata med modellutgångar, vilket kompletterar de kapacitetsutvärderingar som företaget redan publicerar genom sina riskrapporter för ansvarsfull skalning.

Siffror skulle röra sig under en avmattning

Den mest politiskt tillspetsade linjen i inlägget riktar sig direkt mot tempodebatten: Anthropic uppger att den "skulle förvänta sig att dessa siffror skulle skifta om det fanns en samordning om att ta farten på gränsen, som efterlyst av Anthropics vd Dario Amodei." Med andra ord, om branschen verkligen saktar ner, är dessa mätvärden hur allmänheten skulle kunna verifiera det - och om företag påstår sig ta fart medan deras siffror fortsätter att klättra, skulle mätningarna avslöja det också.

Oberoende verifiering är den saknade biten

Anthropic erkänner den centrala svagheten hos självrapporterade mätvärden: den använder sina egna modeller för att utvärdera sina egna system, vilket innebär att "domare"-modellen kan dela blinda fläckarna för den modell som kontrolleras. Företaget noterar också avsaknaden av en gemensam metodik för alla laboratorier, vilket gör jämförelser svåra.

Den föreslagna lösningen är att bädda in oberoende tredjepartsutvärderare från flera organisationer i Anthropic, vilket ger dem tillgång till interna processer, system och data som är jämförbara med vad interna riskbedömningsteam ser. Dessa tredje parter skulle verifiera säkerhetspraxis, rapportera incidenter och övervaka de nya mätvärdena. Företaget säger att METR, den ideella utvärderingen, tidigare självständigt har slagit ihop sin offlineövervakningsplattform och att man planerar att publicera dessa mätningar regelbundet i en form som andra kan verifiera.

Mätningarna knyter an till Anthropics bredare förslag till Advanced AI Framework, som anger "vägregler" för lansering av gränsmodeller, inklusive transparenskrav som regeringar kan kräva - såsom standardiserade riskrapporter.

Ett test för hela branschen

Postens djupare betydelse kan vara konkurrenskraftig. Anthropic utmanar effektivt varje gränslabb att publicera samma siffror, med argumentet att "alla gränsutvecklare skulle kunna publicera dessa åtgärder regelbundet, med hjälp av en offentlig metod." Om rivalerna minskar blir kontrasten sin egen datapunkt i säkerhetsdebatten; om de håller med får branschen den första gemensamma måttstocken för hur snabbt AI verkligen utvecklas.

För närvarande är siffrorna självrapporterade av ett företag med ett uppenbart intresse för pacingkonversationen. Men de representerar något som debatten har saknat: konkreta, repeterbara mätningar som skulle visa om gränsen accelererar, håller sig stadigt eller faktiskt saktar ner.

Ligg före AI

Frontier lab-avslöjande som detta landar varje vecka. För mer banbrytande AI-forskning och branschbevakning, följ AI Buzz Wire.

Läs de senaste AI-nyheterna →