Agenții de inteligență artificială pot finaliza acum 16% din locurile de muncă independente reale la un nivel de calitate pe care l-ar accepta clienții plătitori, conform celor mai recente rezultate ale Remote Labor Index – de peste patru ori mai mult decât rata înregistrată cu doar opt luni în urmă. Descoperirea oferă una dintre cele mai concrete măsuri de până acum privind cât de repede sistemele AI autonome încalcă activitatea profesională creativă și tehnică.
Remote Labor Index (RLI), dezvoltat de Centrul pentru Siguranță AI în colaborare cu Scale Labs, urmărește cât de des agenții AI pot finaliza proiecte freelance valoroase din punct de vedere comercial la calitate profesională. Benchmark-ul acoperă domenii precum design 3D și CAD, arhitectură, design grafic, video și animație, producție audio, analiză de date și dezvoltare de aplicații web. Evaluează 240 de proiecte în valoare totală de 144.000 USD, provenite de la 358 de freelanceri verificați. Evaluatorii umani notează fiecare rezultat în raport cu un standard de aur creat de un profesionist plătit, oferind o imagine empirică a capacităților în creștere industriei AI.
Numerele: o frontieră care s-a mai mult decât cvadruplu
Când a fost lansat pentru prima dată, cel mai bun agent AI a automatizat doar 2,5% din proiecte. Conform celor mai recente rezultate, modelul Anthropic Fable 5 atinge acum 16,1 la sută - cel mai mare scor înregistrat vreodată pe index. Aceasta este aproximativ dublu față de 8,3% pentru Opus 4.8 și cu mult peste 6,3% pentru GPT-5.5.
Toate cele trei modele de frontieră au învins fiecare sistem testat anterior. Liderul anterior, Opus 4.6 care rulează pe framework-ul Claude Cowork, a fost de 4,17 la sută. Frontiera capacității de automatizare a crescut de peste patru ori în mai puțin de opt luni, potrivit autorilor benchmark-ului.
Cu toate acestea, rezultatele nu se mișcă în pas cu datele de lansare. Pe clasamentul complet Scale Labs, noul Gemini 3 Pro aterizează aproape de partea de jos la doar 1,25 la sută, urmând sistemele mult mai vechi. Acest lucru sugerează că capacitatea de model brut nu se traduce automat în tipul de utilizare a instrumentelor și abilități de raționament necesare pentru sarcini profesionale complexe.
Cum funcționează benchmark-ul
Pentru a permite modelelor să-și demonstreze capacitatea deplină, echipa le rulează în aceleași instrumente de dezvoltare pe care inginerii le folosesc zi de zi, inclusiv Claude Code și Codex CLI. Aceste medii au fost extinse cu capacitatea de a opera programe grafice direct.
Fiecare agent AI funcționează într-o mașină virtuală Linux încărcată cu peste 30 de aplicații profesionale, inclusiv Blender pentru modelare 3D, GIMP pentru editarea imaginilor și Audacity pentru producția audio. Proiectelor li se acordă până la 24 de ore de timp de calcul - mult mai mult decât o interacțiune tipică cu chatbot.
Configurația folosește, de asemenea, o buclă critică: un al doilea agent AI revizuiește rezultatul la fel de critic ca un client exigent, iar primul agent își revizuiește apoi activitatea pe baza acelui feedback. Acest lucru oglindește procesul iterativ pe care liber-profesionarii umani îl urmează atunci când perfecționează livrabile.
Unde AI încă rămâne scurt
În ciuda progresului rapid, agenții AI încă nu reușesc să atingă calitatea profesională în marea majoritate a proiectelor. Postarea de blog a benchmark-ului evidențiază exemple specifice în care nici măcar rezultatul modelului de top nu ar trece ca o lucrare terminată.
Într-o sarcină de proiectare a inelului, Fable 5 a produs un rezultat care a fost în mod clar mai bun decât încercările anterioare de AI, dar încă părea neprofesionist la o inspecție atentă. Într-un proiect de arhitectură, GPT-5.5 a falsificat o randare atrăgătoare folosind un generator de imagini, în timp ce modelul său 3D de bază a rămas viciat - o comandă rapidă pe care un client plătitor ar descoperi-o doar prin deschiderea fișierelor sursă.
Una dintre sarcinile mai complexe din benchmark cere agentului să creeze un plan de etaj dimensionat, opțiuni de amenajare a mobilierului și randări fotorealiste pentru baie dintr-un plan cadastral scanat, fotografii ale site-ului și măsurători. Acest flux de lucru în mai mulți pași, care necesită atât precizie tehnică, cât și judecată creativă, rămâne o provocare semnificativă pentru sistemele actuale.
Judecătorii AI evaluează prea generos
Echipa de cercetare a testat, de asemenea, dacă evaluarea umană costisitoare ar putea fi înlocuită de judecători AI. Răspunsul a fost definitiv: evaluatorii AI au evaluat noile modele mult prea generos. Pentru GPT-5.5, scorul arbitrului AI a fost de aproape trei ori prea mare. Pentru Opus 4.8, a fost de aproximativ două ori și jumătate prea mare.
În timp ce judecătorul automat a înțeles corect ordinea generală a clasamentului, cifrele reale au fost umflate semnificativ. Centrul pentru Siguranța Inteligenței Artificiale a explicat raționamentul: pentru a aprecia în mod corect munca livrată, un evaluator trebuie să deschidă fișierele în software-ul profesional corect, să opereze acel software în mod corespunzător și să formeze o judecată așa cum ar face un client plătitor. Acest tip de utilizare practică a software-ului este exact ceea ce agenții actuali de AI se luptă cel mai mult.
Ironia este instructivă: un judecător AI se confruntă cu aceleași limitări ca și lucrătorii AI pe care ar trebui să-i evalueze. Redarea falsă a lui GPT-5.5 este un exemplu – prinderea înșelăciunii necesită deschiderea modelului 3D și inspectarea geometriei reale, o sarcină pe care judecătorul AI nu a putut-o îndeplini în mod fiabil.
Avertisment: restricții guvernamentale
Un avertisment important se aplică scorului principal al lui Fable 5. Doar 218 din cele 240 de proiecte au putut fi evaluate înainte ca guvernul Statelor Unite să restricționeze accesul la model. Chiar și în cel mai rău scenariu, în care Fable 5 a eșuat fiecare proiect rămas, rata de automatizare ar fi totuși cu 14,6% - mai mare decât orice alt model testat.
Restricțiile guvernamentale, legate de preocupările de securitate națională cu privire la modelele de clasă Mythos, au limitat fereastra de evaluare, dar nu au subminat concluzia fundamentală: agenții AI se apropie rapid de punctul în care pot gestiona o parte semnificativă a muncii profesioniste independente.
Pentru freelanceri, tendința este serioasă, dar nu încă catastrofală. AI încă eșuează în 84% din proiecte, iar exemplele benchmark-ului arată că chiar și rezultatele de succes necesită adesea o revizuire profesională. Dar, cu rata de automatizare mai mult decât de patru ori în mai puțin de un an, traiectoria este clară. Întrebarea nu mai este dacă agenții AI vor concura pentru munca independentă, ci cât de repede vor reduce decalajul rămas.
Rămâi înaintea AI
Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →


