Anthropic a publicat săptămâna aceasta o privire inedită de acest fel în interiorul propriului pipeline de dezvoltare, dezvăluind că modelul său Claude „conduce” acum 26% din activitatea de cercetare și dezvoltare AI la companie – în creștere de la sub 1% în februarie 2026. Cifrele au apărut într-o postare pe blogul companiei intitulată „Măsurări pentru înțelegerea ritmului dezvoltării AI”, raportate de Reuters în septembrie 17, raportate de Anthropic și Reuters. The Washington Post și alte magazine.
Postarea este parțial un exercițiu de transparență și parțial un argument: Anthropic vrea ca alte laboratoare de frontieră să publice aceleași tipuri de numere, astfel încât publicul și guvernele să poată urmări cât de repede AI primește cheile pentru construirea AI. For more context on this story, see our ongoing AI industry coverage.
Trei numere pentru a urmări dezvoltarea AI
Compania a propus trei măsurători despre care spune că luminează ritmul de dezvoltare în laboratoarele de frontieră: cât de mult din cercetarea și dezvoltarea IA este realizată de AI în sine, cât de bine sunt supravegheate acțiunile agenților AI și modul în care calculul este alocat între munca de capacitate și munca de siguranță.
Numărul principal provine din ceea ce Anthropic numește Indexul său de automatizare a cercetării și dezvoltării. Compania a catalogat fiecare tip de activitate de cercetare-dezvoltare AI efectuată la companie, a evaluat cât de automatizată este fiecare sarcină în prezent și a agregat rezultatele utilizând o scară dezvoltată de grupul de cercetare Epoch AI. Scala merge de la AL0 (fără implicare AI) la AL5 (AI funcționează complet autonom, fără om în buclă), cu AL3 ceea ce înseamnă că AI „colaborează” la bucăți mari de lucru sub direcția umană apropiată și AL4 înseamnă că AI „conduce”, completând cea mai mare parte a sarcinii de la un capăt la altul de la un prompt la nivel înalt în timp ce un om supraveghează.
În august 2026, a raportat Anthropic, Claude conduce 26% din activitatea de cercetare și dezvoltare IA a companiei. Ponderea muncii la sau peste nivelul „AI colaborează” este peste 90%. Claude nu funcționează complet autonom pentru niciun subset măsurat de activități de cercetare și dezvoltare IA.
30.000 de agenți, un monitor
A doua măsurătoare se referă la supraveghere. Anthropic a dezvăluit că, în august 2026, existau aproximativ 30.000 de agenți care făceau lucrări de cercetare și inginerie la companie la un moment dat pe platforma sa internă cea mai utilizată.
Fiecare acțiune pe care aceștia o fac agenții trece printr-un monitor online înainte de a fi executată, de obicei în câteva secunde, potrivit postării. Anthropic spune că a analizat peste un miliard de decizii din partea agenților săi de cercetare și inginerie în luna august și a constatat că ponderea activităților blocate sau escalate de monitoare a fost de 0,002%.
Cu privire la alocarea calculelor, a treia măsurătoare, compania a spus că, în timpul săptămânii examinate, aproximativ 6% din calculul care a mers către cercetare și dezvoltare AI a fost alocat pentru siguranță.
Construiește-și propriul succesor — sub supravegherea oamenilor
Încadrarea contează la fel de mult ca și figurile. Modelele lui Anthropic participă din ce în ce mai mult la construirea următoarei generații de aceleași modele – ceea ce cercetătorii numesc auto-îmbunătățire recursivă și ceea ce titlul The Washington Post a descris mai direct ca un chatbot „preluând munca de construire a propriului succesor”.
Anthropic are grijă să tragă o linie între „AI conduce” și „AI înlocuiește”. La AL4, un om încă supraveghează și poate interveni; compania a raportat în mod explicit că niciun subset măsurat al activității sale de cercetare și dezvoltare nu rulează la AL5. Dar traiectoria este abruptă: trecerea de la sub 1% la 26% în aproximativ șapte luni sugerează că ponderea muncii conduse de AI ar putea trece la jumătate cu mult înainte de sfârșitul deceniului, dacă tendințele actuale se mențin.
Metodologia are limite reale, iar Anthropic așa spune. Evaluările sale de automatizare au fost produse prin eșantionarea propriilor înregistrări de lucru ale companiei - inclusiv mesajele Slack și documentația internă - și prin faptul că atât oamenii, cât și un model de judecător evaluează cât de automatizată este fiecare sarcină. Într-un test orb, personalul a evaluat sarcinile fără să știe ce dovezi au adunat modelele. Compania a raportat că judecătorul său model a fost de acord cu oamenii aproximativ la fel de des pe cât oamenii au fost de acord unul cu celălalt: acordul exact de la model la om a fost de 59%, în timp ce acordul de la om la om a fost de doar 35%, iar evaluările modelului și ale oamenilor au ajuns la un nivel unul față de celălalt în 97% din timp.
De asemenea, compania a recunoscut riscul autoreferențial în propria metodologie: Anthropic și-a folosit propriile modele pentru a ajuta la evaluarea sistemelor sale, ceea ce ar putea însemna că modelul judecătorului face aceleași tipuri de erori ca și modelul pe care îl verifică. Verificarea de la terți, susține, este adevăratul răspuns.
Ochii din afară vin
În acest scop, Anthropic spune că intenționează să încorporeze evaluatori independenți de la terți din mai multe organizații în interiorul companiei, oferindu-le acces la procese, sisteme și date interne comparabile cu ceea ce au echipele interne de evaluare a riscurilor. METR, organizația externă de cercetare AI, nonprofit, a creat anterior platforma de monitorizare offline a Anthropic.
Dezvăluirea vine pe fondul unei dezbateri crescânde despre ritm. CEO-ul Anthropic, Dario Amodei, a cerut coordonare pentru încetinirea frontierei, iar compania observă că propriile numere ar fi de așteptat să se schimbe dacă ar exista o astfel de coordonare. Săptămâna aceasta, Anthropic și OpenAI au făcut, de asemenea, subiectul unei scrisori publice din partea experților în siguranță, susținând că laboratoarele au nevoie de evaluatori de siguranță cu adevărat independenți.
Întrebarea deschisă este dacă rivalii urmează exemplul lui Anthropic. Compania susține că orice dezvoltator de frontieră ar putea publica aceste măsuri în mod regulat folosind o metodologie publică. Până când o vor face, singurele numere publice despre cât de repede AI construiește IA provin din laboratoarele în sine.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →