OpenAI:s GPT-6 Astra har publicerat toppmoderna resultat på ARC-AGI-3, det abstrakta resonemangsriktmärket utformat för att mäta agentintelligens, enligt resultat publicerade på onsdagen av ARC Prize Foundation. Modellen fick 62,7 % på riktmärkets semi-privata set under stiftelsens standardsele och 99,9 % när den utvärderades med en leverantörsadapter som bevarar modellens interna resonemangstillstånd mellan förfrågningar.
Resultaten landade en dag efter att OpenAI påbörjade den stegvisa lanseringen av Astra, flaggskeppsmodellen som företaget har utformat som början på en ny era. För läsare som försöker hålla poängen när frontier labs handelsriktmärke blåser, spårar sidan senaste AI-utvecklingen varje större utgåva när den händer.
Två selar, två mycket olika poäng
Glappet mellan Astras två rubriksiffror är den viktigaste detaljen i rapporten. ARC Prize utvärderar agenter under olika selar, och var och en ändrar vad modellen får göra med sitt eget sammanhang.
Under standardselen kan en modell föra vidare anteckningar som den väljer att behålla när den arbetar genom en miljö. Med den inställningen fick Astra vid maximal resonemangssatsning 62,7 %, till en total kostnad av $26 098 för utvärderingskörningen. I den motsatta änden, att köra samma sele med avstängt resonemang gav bara 35,2 % samtidigt som det kostade mer – 49 791 USD – eftersom modellen behövde många fler åtgärder för att göra framsteg.
Provider Adapter-selen är mer generös: den bevarar modellens ogenomskinliga resonemangstillstånd mellan förfrågningar och använder komprimering för längre konversationer, vilket gör att Astra kan återanvända tidigare arbete. Under den selen fick Astra 99,9 % vid hög resonemangsansträngning för 18 817 $ och 98,6 % vid maximal ansträngning för 17 332 $. Även den lägsta resonemangsinställningen nådde 96,7%.
Med andra ord, skillnaden mellan en partiell poäng och en nästan perfekt en är inte enbart rå kapacitet - det är hur mycket av modellens arbetstillstånd som överlever mellan stegen.
Slå människor på handlingseffektivitet
ARC-AGI-3 är byggd kring nya, abstrakta, turbaserade spelmiljöer. Agenter måste utforska utan instruktioner, sluta sig till hur världen fungerar, identifiera mål från sparsamma belöningar och planera flerstegsåtgärder. Miljöerna är kalibrerade så att människor kan lösa 100 % av dem, vilket gör mänsklig prestation till baslinjen riktmärket mäter mot.
Astra löste inte bara de flesta nivåer – det löste dem effektivt. Enligt ARC Prize använde modellen färre åtgärder än den mediantestade människan på 96 % av nivåerna, vilket överträffade den mänskliga baslinjen i handlingseffektivitet över hela setet.
Ekonomin i jämförelsen är skarp. Mänskliga testdeltagare betalades $115 per 90-minuters session plus $5 per avslutat spel, vilket räknade till ungefär $12,78 per försökt spel. En fullständig Astra-utvärderingskörning kostar fem siffror, beroende på konfiguration. Men ARC Prize noterade en kontraintuitiv rynka: högre resonemangsansträngning kostar i allmänhet mindre, eftersom Astra löste spel med färre åtgärder, vilket minskade det totala antalet modellanrop och tokens som brändes per körning.
En modell som bygger sitt eget språk
Utöver poängen framhävde ARC Prize ett kvalitativt beteende som laget observerade. Astra förvandlade konsekvent obekanta miljöer till kompakta symboliska världsmodeller – som representerar spelmekanik som logiska regler, och utvecklade sin egen domänspecifika stenografi för att spåra tillstånd och planera åtgärder.
Det är just den färdigheten ARC-AGI-3 designades för att undersöka. Där tidigare generationer av riktmärket testade flytande resonemang över nya mönster, testar den tredje generationen om en agent kan utforska, modellera, sätta mål och genomföra planer i miljöer som den aldrig har sett – komponenterna som ARC Prize listar som utforskning, modellering, målsättning och planering och genomförande.
AGI-erans bakgrund
Benchmark-resultaten kom med maximal retorik från OpenAI själv. Vid en pressträff innan torsdagens lansering sa företagets president Greg Brockman att det "inte var orimligt att känna att vi nu befinner oss i AGI-eran", samtidigt som han slutade med en formell deklaration, enligt The New Stacks bevakning av lanseringen. Han beskrev AGI som ett "missionskoncept eller andligt koncept" snarare än en kontraktuell utlösande faktor.
OpenAI-forskaren Aidan Clark sa att Astra var företagets största träningskörning hittills – den första förtränade på mer än 100 000 GPU:er på Stargate-platsen i Texas – och den första OpenAI-utgåvan där tidigare modeller spelade en betydande roll i att övervaka träningsprocessen. Åtkomsten förblir stegrad: utbyggnaden börjar med företagskunder i Daybreak-programmet, med Plus-, Pro-, Business- och Enterprise-tillgänglighet plus API- och AWS-åtkomst som utlovas under de kommande dagarna.
Asterisken på poängen
Försiktighet är motiverad på flera fronter. Astras ARC-AGI-3-prestanda beror starkt på selekonfigurationen, som de två rubrikerna visar, och anpassade selar som bevarar modelltillståndet har varit en återkommande stridspunkt i benchmark-tvister. The New Stacks analys av lanseringen noterade att Astra "lägger stora vinster på specialiserade uppgifter, men det kommer till en premie och leder inte tydligt kodningspaketet" - en påminnelse om att agentiska pusselriktmärken och vardagliga kommersiella arbetsbelastningar mäter olika saker.
ARC Prize själv ramar in övningen som att mäta "restgapet" mellan nuvarande AI och AGI, och definierar AGI som förmågan att förvärva alla färdigheter som en människa kan, lika effektivt som en människa kan. Ett nästan perfekt resultat under gynnsamma förhållanden täpper inte till det gapet av sig självt. Och för $17 000 till $50 000 per utvärderingskörning är det bara laboratorier med goda resurser som har råd att köra riktmärket i denna skala – även om ARC Prizes kostnadsdata visar att smartare resonemang faktiskt kan krympa räkningen.
Varför det är viktigt
Åtgärdseffektivitet är en genuint ny jämförelseaxel. En modell som löser alla nivåer men slösar bort tusentals samtal på att göra det är mindre användbar – och dyrare – än en som agerar som Astra gjorde här: utforskar medvetet, komprimerar det den lär sig och agerar utifrån det. Vad man än drar slutsatsen om AGI-debatten, visar ARC Prize-data att gränsagenter nu matchar människor inte bara om huruvida de kan lösa nya problem, utan om hur ekonomiskt de löser dem.
Ligg före AI
Varje benchmarkresultat, modelllansering och säkerhetsdebatt, spåras när de händer — läs mer AI-nyheter →
