Cercetătorii Nvidia au construit un sistem de agenți care a împins Claude Opus 5 de la Anthropic la un scor perfect de 100% pe ARC-AGI-3, unul dintre cele mai exigente criterii de raționament interactiv din AI - folosind exact același model care obține un scor de 30% atunci când rulează singur. Rezultatul, publicat vineri pe blogul tehnic Nvidia, este cea mai puternică dovadă de până acum că software-ul înconjurat în jurul unui model de frontieră contează la fel de mult ca modelul în sine. Pentru oricine urmărește cele mai recente evoluții AI, aceasta marchează o schimbare în ceea ce privește avantajul competitiv în AI agentic.

Sistemul se numește AVO, prescurtare de la Agentic Variation Operators, și este interpretarea de către Nvidia a unei arhitecturi de uz general pentru agenți autonomi pe orizont lung - AI care poate rămâne la sarcină ore sau zile în loc să răspundă la o singură solicitare. Pe platoul public ARC-AGI-3, AVO a înregistrat un scor RHAE de 100,00 în toate cele 25 de medii de joc, completând toate cele 183 de niveluri în 6.624 de acțiuni de mediu folosind Claude Opus 5 ca model backend.

Ce testează de fapt ARC-AGI-3

ARC-AGI-3 este un benchmark interactiv de raționament creat de fundația ARC Prize. Un agent este aruncat în medii nefamiliare, asemănătoare unui joc, fără instrucțiuni, fără reguli declarate și fără un scop declarat. Trebuie să exploreze prin încercări și erori, să deducă modul în care funcționează mediul, să descopere ce înseamnă „câștig” și apoi să acționeze suficient de eficient pentru a trece prin niveluri din ce în ce mai dificile.

Indicatorul de punctaj al benchmark-ului, Relative Human Action Efficiency (RHAE), combină finalizarea sarcinilor cu cât de puține acțiuni le irosește agentul în comparație cu jucătorii umani începători. Asta îl face un test brutal de autonomie susținută: agentul trebuie să-și amintească ceea ce a învățat, să-și revină din greșeli și să-și bugeteze acțiunile cu atenție pe parcursul întregii curse.

Numărul titlului Nvidia câștigă context dintr-o comparație. VISTA, un ham anterioară cu interacțiune directă care a folosit și Claude Opus 5, a finalizat aceleași 183 de niveluri publice în 7.542 de acțiuni de mediu. AVO a avut nevoie de aproximativ 12% mai puține acțiuni pentru a finaliza lucrarea, potrivit postării pe blog a Nvidia.

De la nucleele GPU la jocurile necunoscute

AVO nu a fost construit pentru puzzle-uri. Nvidia a demonstrat mai întâi arhitectura privind optimizarea kernelului GPU, un domeniu în care micile modificări ale codului pot afecta corectitudinea, comportamentul memoriei și debitul în moduri imprevizibile. Într-un studiu privind nucleul de atenție, AVO a funcționat continuu timp de șapte zile, a explorat peste 500 de direcții de optimizare și a comis 40 de versiuni de nucleu. Pe sistemele NVIDIA DGX B200, nucleele de atenție multihead rezultate au depășit cuDNN cu până la 3,5% și FlashAttention-4 cu până la 10,5%. Agentul și-a adaptat apoi nucleul evoluat la atenția interogării grupate în aproximativ 30 de minute de lucru autonom suplimentar.

Aceeași buclă de bază - inspectați, planificați, implementați, testați, evaluați - a fost apoi îndreptată către ARC-AGI-3 cu doar interfața de activitate schimbată. Două mecanisme reportate. Prima este memoria persistentă, care stochează implementările anterioare, rezultatele evaluării, rezultatele compilatorului și profilelor și raționamentul acumulat, astfel încât agentul să poată relua din starea sa actuală, mai degrabă decât să reconstruiască contextul de la zero. Al doilea este un supervizor, un al doilea agent care urmărește traiectoria generală și intervine atunci când progresul se blochează.

Supraveghetorul este descoperirea

TechCrunch, care l-a intervievat pe Adel El Hallak de la Nvidia, vicepreședinte de produs în unitatea AI a companiei, l-a evidențiat pe supervizor ca fiind cel mai important ingredient. „Aproape că acționează ca un CEO să-l împingă pe agent atunci când acesta iese din direcție sau începe să exploreze o cale care ar putea duce la o fundătură sau să reexploreze o cale pe care a parcurs-o anterior”, a spus El Hallak publicației.

Diferența de performanță este puternică. Testarea Nvidia a constatat că Claude Opus 5 fără un ham sofisticat a reușit un scor de 30% la ARC-AGI-3 - cel mai bun rezultat dintre modelele goale testate, dar nici pe departe o rulare completă. Modelele OpenAI au obținut un punctaj sub 10% la benchmark, iar compania și-a publicat luna trecută propria cercetare, care arată că ajustarea a doar două setări de cablaj și-a triplat scorurile. Nicio configurație numai pentru model nu s-a apropiat de 100% pe care AVO a obținut-o.

În special, configurația AVO a rulat într-o modalitate de doar text: fiecare observație a fost furnizată ca o grilă de text exactă de 64x64, fără imagini sau simboluri de imagine trimise modelului. Puterea de raționament a venit din bucla din jurul modelului, nu din percepția multimodală.

De ce industria pariază pe hamuri

Descoperirea ajunge pe fondul unui val de dovezi că infrastructura agenților, nu capacitatea modelului brut, este blocajul actual pentru AI autonomă. Databricks a publicat o cercetare de evaluare comparativă în iulie, care arată că hamul are un impact dramatic atât asupra performanței, cât și asupra costurilor. „Puteți alege același model, dar hamuri diferite și obțineți un cost semnificativ mai mare dacă folosiți ham greșit”, a declarat CEO-ul Databricks Ali Ghodsi pentru TechCrunch. „Asta în sine poate de două ori costul tău.”

El Hallak a încadrat argumentul mai larg al Nvidiei în termeni de deschidere. „Credem că avem o stivă de agenți deschisă – în care aveți controlul asupra cablajului, asupra infrastructurii, în timpul de execuție – este ceea ce este necesar pentru a conduce ecosistemul înainte și în siguranță”, a spus el. Nvidia are piese de tehnologie de hamuri de dimensiuni deschise sub marca sa NeMo, iar cercetarea AVO este documentată într-o lucrare despre arXiv.

Un etalon cu istorie

ARC-AGI-3 a devenit un punct de foc în rivalitatea frontier-laborator. OpenAI a susținut anterior rezultate puternice pentru modelul său GPT-5.6 Sol la benchmark, atrăgând o atenție asupra setărilor de evaluare utilizate. Rezultatul Nvidia ocolește această dezbatere într-un sens - nu pretinde un model mai inteligent, ci doar un agent mai bine conceput în jurul unuia existent.

Mesajul pentru dezvoltatori și întreprinderi care construiesc produse agentice este direct: selecția modelului încă contează, dar designul sistemului decide acum dacă un model de frontieră oferă rezultate de frontieră. După cum spune Nvidia, evaluarea unui model nu este același lucru cu evaluarea unui agent - iar tabelele de referință din 2026 răsplătesc din ce în ce mai mult inginerii care construiesc schelele.

Rămâi înaintea AI

Arhitecturile agenților se mișcă mai repede ca niciodată, iar diferența dintre un ham bun și unul prost este acum măsurat în puncte de referință și dolari reali. Urmărește AI Buzz Wire pentru acoperirea zilnică, verificată la sursă, a cercetării AI, a reperelor și a lansărilor de produse.

Citiți mai multe știri despre cercetarea AI →