OpenAI GPT-6 Astra zveřejnila nejnovější výsledky na ARC-AGI-3, abstraktním uvažovacím benchmarku určeném k měření agentní inteligence, podle výsledků zveřejněných ve středu nadací ARC Prize Foundation. Model dosáhl 62,7 % na srovnávací sadě Semi-Private v rámci standardního svazku nadace a 99,9 % při hodnocení s kabelem poskytovatele adaptéru, který zachovává vnitřní stav uvažování modelu mezi požadavky.

Výsledky se dostavily den poté, co OpenAI zahájila postupné zavádění Astry, vlajkového modelu, který společnost označila za začátek nové éry. Pro čtenáře, kteří se snaží udržet skóre v době, kdy obchodní benchmark Frontier labs fouká, stránka nejnovější vývoj AI sleduje každé hlavní vydání tak, jak k němu dojde.

Dva postroje, dvě velmi rozdílná skóre

Rozdíl mezi dvěma titulními čísly Astry je nejdůležitějším detailem zprávy. ARC Prize hodnotí agenty pod různými postroji a každý mění, co je modelu dovoleno dělat s jeho vlastním kontextem.

V rámci standardního postroje může model přenášet poznámky, které se rozhodl zachovat, když pracuje v prostředí. S tímto nastavením dosáhla Astra při maximálním úsilí 62,7 % při celkových nákladech 26 098 USD za zkušební běh. Na opačném konci provozování stejného postroje s vypnutým uvažováním vyprodukovalo pouhých 35,2 % a stálo více – 49 791 USD – protože model potřeboval mnohem více akcí, aby dosáhl pokroku.

Kabel poskytovatele adaptéru je velkorysejší: zachovává neprůhledný stav uvažování modelu mezi požadavky a používá komprimaci pro delší konverzace, takže Astra může znovu použít předchozí práci. S tímto postrojem dosáhla Astra 99,9 % při vysokém úsilí za 18 817 $ a 98,6 % při maximálním úsilí za 17 332 $. Dokonce i nejnižší nastavení uvažování dosáhlo 96,7 %.

Jinými slovy, rozdíl mezi částečným a téměř dokonalým skóre nespočívá pouze v hrubé schopnosti – jde o to, kolik z pracovního stavu modelu přežije mezi jednotlivými kroky.

Porazit lidi efektivitou akce

ARC-AGI-3 je postaven na nových, abstraktních, tahových herních prostředích. Agenti musí prozkoumávat bez instrukcí, odvodit, jak svět funguje, identifikovat cíle z řídkých odměn a plánovat akce ve více krocích. Prostředí jsou kalibrována tak, aby je lidé mohli na 100 % vyřešit, díky čemuž je lidský výkon základním měřítkem.

Astra většinu úrovní nejen vyřešila, ale vyřešila je efektivně. Podle ARC Prize model použil méně akcí než medián testovaného člověka na 96 % úrovní, čímž překonal lidskou základní linii v účinnosti akce napříč sadou.

Ekonomika srovnání je strohá. Účastníci testu na lidech dostali zaplaceno 115 USD za 90minutovou relaci plus 5 USD za dokončenou hru, což vyšlo zhruba na 12,78 USD za pokus o hru. Plná zkušební verze Astra stojí pět míst v závislosti na konfiguraci. Ale ARC Prize zaznamenala kontraintuitivní vrásku: vyšší úsilí o uvažování obecně stálo méně, protože Astra vyřešila hry v menším počtu akcí, čímž se snížil celkový počet volání modelu a spálených tokenů za běh.

Model, který si buduje svůj vlastní jazyk

Kromě skóre cena ARC zdůraznila kvalitativní chování, které tým pozoroval. Astra důsledně proměňovala neznámá prostředí na kompaktní symbolické modely světa – představující herní mechanismy jako logická pravidla a vyvíjející vlastní doménově specifickou zkratku pro sledování stavu a plánování akcí.

Přesně to byla dovednost ARC-AGI-3 navržena k prozkoumání. Zatímco dřívější generace benchmarku testovaly plynulé uvažování nad novými vzory, třetí generace testuje, zda agent může prozkoumávat, modelovat, stanovovat cíle a provádět plány v prostředích, která nikdy neviděl – komponenty ARC Prize uvádí jako průzkum, modelování, stanovování cílů a plánování a provádění.

Pozadí éry AGI

Výsledky benchmarku dorazily uprostřed maximální rétoriky samotného OpenAI. Na tiskovém brífinku před čtvrtečním uvedením na trh prezident společnosti Greg Brockman řekl, že „není nerozumné mít pocit, že jsme nyní v éře AGI“, přičemž podle zpravodajství The New Stack o uvedení na trh se zastavil před formálním prohlášením. Popsal AGI jako „koncept mise nebo duchovní koncept“ spíše než smluvní spouštěč.

Výzkumník OpenAI Aidan Clark řekl, že Astra byla doposud největší školicí běh společnosti – první předem vyškolený na více než 100 000 GPU v pobočce Stargate v Texasu – a první vydání OpenAI, ve kterém dřívější modely hrály významnou roli při dohledu nad školicím procesem. Přístup zůstává ve fázi: zavádění začíná u podnikových zákazníků v programu Daybreak s dostupností Plus, Pro, Business a Enterprise plus API a přístup AWS přislíbený v nadcházejících dnech.

Hvězdička na skóre

Opatrnost je namístě na několika frontách. Výkon ARC-AGI-3 Astra do značné míry závisí na konfiguraci kabelových svazků, jak ukazují dvě čísla v titulku, a vlastní kabelové svazky, které zachovávají stav modelu, byly opakujícím se bodem sporu ve sporech o benchmark. Analýza společnosti New Stack při uvedení na trh poznamenala, že Astra „přináší velké zisky na specializovaných úkolech, ale přichází za prémii a nevede jasně v kódovacím balíčku“ – což je připomínka, že benchmarky agentních hlavolamů a každodenní komerční zátěž měří různé věci.

Samotná cena ARC zarámuje toto cvičení jako měření „zbytkové mezery“ mezi současnou umělou inteligencí a AGI a definuje AGI jako schopnost získat jakoukoli dovednost, kterou člověk dokáže, stejně efektivně jako člověk. Téměř dokonalé skóre za příznivých podmínek samo o sobě tuto mezeru nevyrovná. A při ceně 17 000 až 50 000 USD za běh hodnocení si pouze dobře vybavené laboratoře mohou dovolit spustit srovnávací test v tomto měřítku – i když údaje o nákladech ARC Prize ukazují, že chytřejší uvažování může ve skutečnosti snížit účet.

Proč na tom záleží

Účinnost akce je skutečně novou osou srovnání. Model, který řeší každou úroveň, ale plýtvá tím tisíce hovorů, je méně užitečný – a dražší – než model, který funguje jako zde Astra: záměrně prozkoumávat, komprimovat to, co se naučí, a jednat podle toho. Ať už si o debatě o AGI uděláme jakýkoli závěr, data ARC Prize ukazují, že hraniční agenti se nyní shodují s lidmi nejen podle toho, zda dokážou vyřešit nové problémy, ale také podle toho, jak ekonomicky je řeší.

Udržujte si náskok před umělou inteligencí

Každý výsledek benchmarku, uvedení modelu a debata o bezpečnosti, sledovány, jak se to děje — přečtěte si více zpráv o AI →