OpenAI se retrage după ce Claude Opus 5 de la Anthropic a dominat benchmark-ul ARC-AGI-3, publicând rezultate care arată că propriul său model GPT-5.6 Sol atinge 38,3% – cu condiția să folosiți setările preferate ale OpenAI mai degrabă decât hamurile de testare oficiale.
Disputa, care s-a desfășurat la 30 iulie 2026, atinge miezul unei probleme tot mai mari în evaluarea AI: benchmark-urile nu mai măsoară doar un model, ci întregul schelet tehnic înconjurat de acesta. Pentru o analiză mai profundă a cele mai recente dezvoltări AI și a lansărilor de model, AI Buzz Wire urmărește povestea.
Numerele și captura
OpenAI a raportat că GPT-5.6 Sol atinge 38,3 la sută pe ARC-AGI-3, depășind Claude Opus 5 de la Anthropic, care a obținut 30,2 la sută după ce anterior a cvadruplat recordul benchmark-ului. Avertismentul este semnificativ: această cifră de 38,3% depinde de două caracteristici specifice ale API-ului OpenAI Responses.
Primul este Retained Reasoning, care păstrează lanțul de gândire al modelului între pași, mai degrabă decât să-l renunțe după fiecare acțiune. Al doilea este Compact, care rezumă contextul mai vechi în loc să-l trunchieze, permițând modelului să continue să lucreze la probleme lungi fără a pierde raționamentul anterior.
Executați hamurile standardizate oficiale ale ARC Prize – care evită în mod intenționat setările specifice furnizorului pentru a asigura comparații între mere și mere – GPT-5.6 Sol a reușit doar 7,8 la sută. Motivul, susține OpenAI, este că configurația oficială elimină raționamentul modelului după fiecare pas, diminuând performanța la sarcinile care necesită o gândire susținută în mai mulți pași.
Un punct de referință construit pentru puritate
ARC-AGI-3 a fost proiectat de François Chollet și echipa ARC Prize pentru a testa capacitatea unui model de a rezolva noi puzzle-uri de raționament pe care nu le-a mai văzut până acum - un test de inteligență generală, mai degrabă decât cunoștințe memorate. Pentru a menține comparațiile corecte, hamul oficial înlătură în mod deliberat caracteristicile specifice furnizorului, măsurând capacitatea modelului brut într-un mediu neutru.
Contraargumentul OpenAI este că această neutralitate poate deveni un handicap. Compania susține că hamul oficial s-a bazat pe un „API de finalizare în stil OpenAI” mai vechi, căruia îi lipseau capabilitățile pe care API-ul Claude le oferea deja, punând în mod efectiv OpenAI într-un dezavantaj structural față de Anthropic în comparația originală.
În esență, OpenAI spune: ne-ați măsurat modelul cu o mână legată la spate.
Răspunsul lui Chollet
Cofondatorul ARC Prize François Chollet a răspuns trasând o linie clară între două tipuri de configurații de testare. Harnamentele „facute la comandă pentru a rezolva benchmark-ul sau care conțin cunoștințe despre formatul benchmarkului” sunt interzise, a spus el. Dar setările API de uz general „care nu au fost dezvoltate pentru ARC-AGI-3 și care sunt disponibile pentru toți utilizatorii API” sunt un joc corect.
De fapt, Chollet a recunoscut că scorul GPT-5.6 Sol al lui ARC Prize a dezavantajat OpenAI. El a remarcat că organizația a avut „multe întrebări înainte și înapoi cu OpenAI despre cum să-și testeze cel mai bine modelele, în special în ceea ce privește compactarea”, și a salutat compania „începând să descopere răspunsul”.
Chollet a semnalat o preocupare rămasă. Furnizorii diferiți care folosesc setări diferite creează ceea ce el a numit „o potențială problemă de paritate” – dar el consideră că este acceptabil „atâta timp cât setările și costul sunt raportate clar”.
De ce contează asta dincolo de clasament
Episodul subliniază o tensiune care remodelează modul în care industria AI evaluează progresul. Pe măsură ce modelele sunt implementate din ce în ce mai mult prin intermediul API-urilor bogate în funcții, mai degrabă decât ca sisteme de sine stătătoare, linia dintre capacitatea inerentă a unui model și ingineria din jurul acestuia continuă să se estompeze. Un punct de referință care ignoră schelele poate subestima performanța din lumea reală; unul care îl îmbrățișează poate recompensa companiile pentru testul de joc.
Dezbaterea ARC-AGI-3 este puțin probabil să fie ultima. Pe măsură ce modelele de frontieră se adună aproape de vârful punctelor de referință stabilite, dezacordurile cu privire la ceea ce contează ca o măsurare echitabilă - și al căror ham ajunge să stabilească standardul - se vor intensifica.
Rămâi înaintea AI
Doriți să urmăriți știrile de ultimă oră AI despre modele, benchmark-uri și laboratoarele care le construiesc? AI Buzz Wire vă acoperă.
Citiți mai multe știri AI