GPT-6 Astra de la OpenAI a postat rezultate de ultimă generație pe ARC-AGI-3, standardul de raționament abstract conceput pentru a măsura inteligența agentică, potrivit rezultatelor publicate miercuri de Fundația ARC Prize. Modelul a obținut un scor de 62,7% la setul Semi-Privat al benchmark-ului în cadrul cablajului standard al fundației și 99,9% atunci când a fost evaluat cu un cablaj adaptor furnizor care păstrează starea de raționament internă a modelului între solicitări.

Rezultatele au aterizat la o zi după ce OpenAI a început lansarea în etape a Astra, modelul emblematic pe care compania l-a încadrat drept începutul unei noi ere. Pentru cititorii care încearcă să țină scorul pe măsură ce laboratoarele de frontieră bate referință, pagina cele mai recente dezvoltări AI urmărește fiecare lansare majoră așa cum se întâmplă.

Două hamuri, două scoruri foarte diferite

Diferența dintre cele două numere de titlu ale Astrei este cel mai important detaliu din raport. ARC Prize evaluează agenții sub diferite hamuri și fiecare schimbă ceea ce modelului îi este permis să facă cu propriul context.

Sub hamul Standard, un model poate transmite note pe care alege să le păstreze pe măsură ce lucrează printr-un mediu. Cu această configurație, Astra la efort maxim de raționament a obținut un scor de 62,7%, la un cost total de 26.098 USD pentru perioada de evaluare. La capătul opus, rularea aceluiași ham cu raționamentul dezactivat a produs doar 35,2%, în timp ce a costat mai mult - 49.791 USD - deoarece modelul avea nevoie de multe mai multe acțiuni pentru a progresa.

Hamul Provider Adapter este mai generos: păstrează starea de raționament opac a modelului între solicitări și folosește compactarea pentru conversații mai lungi, permițând Astra să refolosească munca anterioară. Sub acest ham, Astra a obținut 99,9% la efort de raționament ridicat pentru 18.817 USD și 98,6% la efort maxim pentru 17.332 USD. Chiar și cea mai scăzută setare de raționament a ajuns la 96,7%.

Cu alte cuvinte, diferența dintre un scor parțial și unul aproape perfect nu este doar capacitatea brută - este cât de mult din starea de lucru a modelului supraviețuiește între pași.

Învingerea oamenilor pentru eficiența acțiunii

ARC-AGI-3 este construit în jurul unor medii de joc noi, abstracte, pe rând. Agenții trebuie să exploreze fără instrucțiuni, să deducă modul în care funcționează lumea, să identifice obiectivele din recompense rare și să planifice acțiuni în mai mulți pași. Mediile sunt calibrate astfel încât oamenii să poată rezolva 100% dintre ele, ceea ce face ca performanța umană să fie punctul de referință pentru măsurarea de referință.

Astra nu doar a rezolvat majoritatea nivelurilor, ci le-a rezolvat eficient. Potrivit ARC Prize, modelul a folosit mai puține acțiuni decât media umană testată la 96% din niveluri, depășind linia de bază umană în eficiența acțiunii în întregul set.

Economia comparației este crudă. Participanții la testul uman au fost plătiți cu 115 USD pe sesiune de 90 de minute plus 5 USD pe joc finalizat, ajungând la aproximativ 12,78 USD pe joc încercat. O evaluare completă a Astra costă cinci cifre, în funcție de configurație. Dar ARC Prize a remarcat o zbârcire contraintuitivă: efortul de raționament mai mare costă, în general, mai puțin, deoarece Astra a rezolvat jocurile în mai puține acțiuni, reducând numărul total de apeluri de model și de jetoane arse pe rulare.

Un model care își construiește propriul limbaj

Dincolo de scoruri, ARC Prize a evidențiat un comportament calitativ pe care l-a observat echipa. Astra a transformat în mod constant mediile nefamiliare în modele compacte ale lumii simbolice – reprezentând mecanica jocului ca reguli logice și și-a dezvoltat propria prescurtare specifică domeniului pentru a urmări starea și a planifica acțiunile.

Tocmai aceasta este abilitatile pe care ARC-AGI-3 a fost conceput pentru a sonda. În cazul în care generațiile anterioare ale benchmark-ului au testat raționamentul fluid asupra modelelor noi, a treia generație testează dacă un agent poate explora, modela, stabilește obiective și executa planuri în medii pe care nu le-a văzut niciodată - componentele ARC Prize listează ca explorare, modelare, stabilire de obiective și planificare și execuție.

Fundalul epocii AGI

Rezultatele de referință au ajuns pe fondul retoricii maxime de la OpenAI însuși. La o conferință de presă înainte de lansarea de joi, președintele companiei, Greg Brockman, a spus că „nu este nerezonabil să simțim că suntem acum în era AGI”, fără a ajunge la o declarație oficială, potrivit acoperirii The New Stack despre lansare. El a descris AGI ca un „concept de misiune sau concept spiritual” mai degrabă decât un declanșator contractual.

Cercetătorul OpenAI Aidan Clark a spus că Astra a fost cea mai mare cursă de instruire a companiei până în prezent – ​​primul pre-antrenat pe mai mult de 100.000 de GPU-uri la site-ul Stargate din Texas – și prima versiune OpenAI în care modelele anterioare au jucat un rol semnificativ în supravegherea procesului de instruire. Accesul rămâne în etape: lansarea începe cu clienții enterprise din programul Daybreak, cu disponibilitatea Plus, Pro, Business și Enterprise plus acces API și AWS promis în zilele următoare.

Asteriscul de pe scor

Se recomandă prudență pe mai multe fronturi. Performanța ARC-AGI-3 a Astra depinde în mare măsură de configurația cablajului, așa cum arată cele două numere principale, iar cablajele personalizate care păstrează starea modelului au fost un punct recurent de disputa în disputele de referință. Analiza lansării efectuată de New Stack a remarcat că Astra „înregistrează câștiguri mari în sarcinile specializate, dar vine cu un premiu și nu conduce în mod clar pachetul de codare” – o reamintire că punctele de referință ale puzzle-urilor și sarcinile comerciale de zi cu zi măsoară lucruri diferite.

ARC Prize însuși încadrează exercițiul ca măsurarea „decalajului rezidual” dintre IA actuală și AGI, definind AGI ca abilitatea de a dobândi orice abilitate pe care o poate face un om, la fel de eficient ca un om. Un scor aproape perfect în condiții favorabile nu reduce decalajul de la sine. Și, de la 17.000 până la 50.000 USD per ciclu de evaluare, numai laboratoarele bine dotate își permit să ruleze reperul la această scară – deși datele despre costuri ale ARC Prize arată că un raționament mai inteligent poate reduce factura.

De ce contează

Eficiența acțiunii este o axă de comparație cu adevărat nouă. Un model care rezolvă fiecare nivel, dar irosește mii de apeluri făcându-l este mai puțin util – și mai scump – decât unul care acționează ca Astra aici: explorează în mod deliberat, comprimă ceea ce învață și acționează pe baza lui. Indiferent de concluziile cu privire la dezbaterea AGI, datele premiului ARC arată că agenții de frontieră se potrivesc acum cu oamenii nu doar dacă pot rezolva probleme noi, ci și cât de economic le rezolvă.

Rămâi înaintea AI

Fiecare rezultat de referință, lansare de model și dezbatere privind siguranța, urmărite pe măsură ce se întâmplă — citește mai multe știri despre AI →