Anthropic a publicat sâmbătă un set detaliat de automăsurări menite să permită publicului, jurnaliştilor şi guvernelor să urmărească cât de repede este dezvoltată AI de frontieră – inclusiv un indice inedit de acest fel despre cât de multă cercetare a companiei este efectuată acum de AI, precum şi dezvăluirea că aproximativ 30.000 de agenţi AI lucrează în orice moment în cadrul companiei.

Postarea, intitulată „Măsurări pentru înțelegerea ritmului dezvoltării AI în laboratoarele de frontieră”, ajunge în centrul celui mai important argument din industrie: dacă dezvoltarea frontierei ar trebui încetinită în mod deliberat. Dario Amodei a cerut coordonare pentru a „pasa frontiera”, o propunere care a zdruncinat piețele, a atras un proces pentru consumatori care pretindea o coluziune între marile laboratoare și l-a determinat pe președintele Trump să anunțe o „Forță AI” dedicată prevenirii oricărei încetiniri. Încadrarea lui Anthropic este explicită în acest context: „Pe măsură ce lumea ia în considerare încetinirea ritmului de dezvoltare a IA de frontieră, publicul are nevoie de mai multe informații”.

Trei măsurători pentru urmărirea progresului AI

Compania a stabilit trei zone de măsurare pe care susține că orice laborator de frontieră le-ar putea publica în mod regulat:

1. Cât de mult din cercetarea și dezvoltarea IA este realizată de AI în sine. Anthropic a construit un prototip „Index de automatizare a cercetării și dezvoltării antropice” prin catalogarea tuturor tipurilor de activități de cercetare și dezvoltare AI efectuate la companie, evaluând cât de automatizată este fiecare sarcină în prezent și cumulând rezultatele. Evaluările folosesc scala publică „Nivel de automatizare” a Epoch AI, care variază de la AL0 (fără implicare AI) la AL5 (AI funcționează complet autonom, fără niciun om în buclă). La această scară, AL3 înseamnă AI „colaborează” – efectuând o mare parte de muncă sub o direcție umană apropiată – în timp ce AL4 înseamnă AI „conduce”, completând cea mai mare parte a sarcinii de la un capăt la altul de la un prompt la nivel înalt în timp ce un om supraveghează.

Scopul indexului este de a măsura cât de aproape se apropie orice laborator de auto-îmbunătățirea recursivă - un model care își construiește în mod complet propriul succesor. Anthropic observă că modelele care accelerează dezvoltarea AI „ar putea face mai dificilă pentru oameni să înțeleagă sau să controleze aceste sisteme”.

2. Cât de bine sunt supravegheate acțiunile agenților AI. Aici apare cifra de 30.000. În august 2026, aproximativ 30.000 de agenți făceau lucrări de cercetare și inginerie la un moment dat în cadrul celei mai utilizate platforme interne a Anthropic, delegându-și sarcini unul altuia și lucrând semi-autonom pentru perioade lungi de timp. Compania măsoară trei lucruri despre supravegherea acelor agenți: acoperire (ponderea acțiunilor agenților care trec printr-un monitor înainte sau după execuție), latența revizuirii (cât de rapid sunt revizuite acțiunile semnalate, mai întâi de un monitor automat și apoi de un om) și rata de escaladare (ponderea activităților blocate, redirecționate sau semnalate pentru revizuire).

Datele de monitorizare Anthropic de până acum sugerează că agenții individuali rareori se comportă greșit – dar compania avertizează că „când există milioane sau miliarde de agenți care operează în economie, chiar și evenimente rare se pot întâmpla în mod regulat”.

3. Cum este alocat calculul. A treia măsurătoare urmărește modul în care sunt distribuite resursele de calcul ale laboratorului - intrarea brută care se corelează cu capabilitățile modelului. Împreună cu celelalte două metrici, Anthropic susține că acest lucru oferă celor din afară o modalitate de a corela intrările modelului cu rezultatele modelului, completând evaluările de capabilități pe care compania le publică deja prin rapoartele de risc ale politicii de scalare responsabilă.

Numerele s-ar deplasa sub o încetinire

Cea mai indicată din punct de vedere politic din postare vizează direct dezbaterea privind ritmul: Anthropic afirmă că „s-ar aștepta ca aceste cifre să se schimbe dacă ar exista o coordonare în ceea ce privește ritmul frontierei, așa cum a solicitat CEO-ul Anthropic, Dario Amodei”. Cu alte cuvinte, dacă industria încetinește cu adevărat, aceste valori sunt modul în care publicul ar putea verifica acest lucru - și dacă companiile pretind că își desfășoară ritmul în timp ce numărul lor continuă să crească, măsurătorile ar expune și acest lucru.

Verificarea independentă este piesa lipsă

Anthropic recunoaște slăbiciunea centrală a metricilor auto-raportate: își folosește propriile modele pentru a-și evalua propriile sisteme, ceea ce înseamnă că modelul „judecător” ar putea împărtăși punctele moarte ale modelului care este verificat. Compania observă, de asemenea, lipsa unei metodologii comune între laboratoare, ceea ce face comparațiile dificile.

Remediul propus este de a încorpora evaluatori terți independenți din mai multe organizații în cadrul Anthropic, oferindu-le acces la procese interne, sisteme și date comparabile cu ceea ce văd echipele interne de evaluare a riscurilor. Aceste terțe părți ar verifica practicile de siguranță, vor raporta incidente și vor monitoriza noile valori. Compania spune că METR, organizația nonprofit de evaluare, și-a creat anterior în mod independent platforma de monitorizare offline și că intenționează să publice aceste măsurători în mod regulat într-o formă pe care alții o pot verifica.

Măsurătorile se leagă de propunerea mai amplă a Advanced AI Framework a Anthropic, care stabilește „reguli de drum” pentru lansările de modele de frontieră, inclusiv obligațiile de transparență pe care guvernele le-ar putea cere – cum ar fi rapoartele de risc standardizate.

Un test pentru întreaga industrie

Semnificația mai profundă a postului poate fi competitivă. Anthropic provoacă efectiv fiecare laborator de frontieră să publice aceleași numere, argumentând că „orice dezvoltator de frontieră ar putea publica aceste măsuri în mod regulat, folosind o metodologie publică”. Dacă rivalii declin, contrastul devine propriul punct de date în dezbaterea privind siguranța; dacă sunt de acord, industria câștigă primul criteriu comun pentru cât de repede avansează AI.

Deocamdată, cifrele sunt auto-raportate de o companie cu un interes evident pentru conversația de ritm. Dar ele reprezintă ceva ce i-a lipsit dezbaterii: măsurători concrete, repetabile, care ar arăta dacă frontiera se accelerează, se menține constantă sau chiar încetinește.

Rămâi înaintea AI

Dezvăluirile de laborator de frontieră ca aceasta ajung săptămânal. Pentru mai multe cercetări de ultimă oră și acoperire din industrie, urmați AI Buzz Wire.

Citiți cele mai recente știri despre AI →