GPT-6 Astra di OpenAI ha pubblicato risultati all'avanguardia su ARC-AGI-3, il benchmark del ragionamento astratto progettato per misurare l'intelligenza degli agenti, secondo i risultati pubblicati mercoledì dalla ARC Prize Foundation. Il modello ha ottenuto un punteggio del 62,7% nel set semi-privato del benchmark con il cablaggio standard della fondazione e del 99,9% quando valutato con un cablaggio dell'adattatore del fornitore che preserva lo stato di ragionamento interno del modello tra le richieste.

I risultati sono arrivati ​​un giorno dopo che OpenAI ha iniziato il lancio graduale di Astra, il modello di punta che l’azienda ha definito come l’inizio di una nuova era. Per i lettori che cercano di tenere traccia dei punteggi mentre i benchmark commerciali di Frontier Labs aumentano, la pagina ultimi sviluppi dell'intelligenza artificiale tiene traccia di ogni importante rilascio nel momento in cui avviene.

Due finimenti, due partiture molto diverse

Il divario tra i due numeri principali di Astra è il dettaglio più importante del rapporto. ARC Prize valuta gli agenti sotto diversi aspetti e ognuno cambia ciò che il modello può fare con il proprio contesto.

Sotto l'imbracatura Standard, un modello può portare avanti le note che sceglie di conservare mentre attraversa un ambiente. Con questa impostazione, Astra al massimo sforzo di ragionamento ha ottenuto il 62,7%, per un costo totale di $ 26.098 per la corsa di valutazione. All’estremità opposta, eseguire lo stesso cablaggio con il ragionamento disattivato ha prodotto solo il 35,2% costando di più – $ 49.791 – perché il modello aveva bisogno di molte più azioni per fare progressi.

Il cablaggio del Provider Adapter è più generoso: preserva lo stato di ragionamento opaco del modello tra le richieste e utilizza la compattazione per conversazioni più lunghe, consentendo ad Astra di riutilizzare il lavoro precedente. Sotto questo profilo, Astra ha ottenuto il 99,9% con uno sforzo di ragionamento elevato per $ 18.817 e il 98,6% con uno sforzo massimo per $ 17.332. Anche l'impostazione di ragionamento più bassa ha raggiunto il 96,7%.

In altre parole, la differenza tra un punteggio parziale e uno quasi perfetto non è solo legata alle capacità grezze, ma riguarda la quantità di stato di funzionamento del modello che sopravvive tra i passaggi.

Battere gli esseri umani sull'efficienza dell'azione

ARC-AGI-3 è costruito attorno ad ambienti di gioco nuovi, astratti e a turni. Gli agenti devono esplorare senza istruzioni, dedurre come funziona il mondo, identificare obiettivi da ricompense scarse e pianificare azioni in più fasi. Gli ambienti sono calibrati in modo che gli esseri umani possano risolverli al 100%, il che rende le prestazioni umane il punto di riferimento rispetto al quale misurare il benchmark.

Astra non si è limitata a risolvere la maggior parte dei livelli, ma li ha risolti in modo efficiente. Secondo ARC Prize, il modello ha utilizzato meno azioni rispetto alla media umana testata nel 96% dei livelli, superando la linea di base umana in termini di efficienza delle azioni in tutto il set.

Gli aspetti economici del confronto sono crudi. I partecipanti al test umano sono stati pagati 115 dollari per sessione di 90 minuti più 5 dollari per gioco completato, arrivando a circa 12,78 dollari per ogni tentativo di gioco. Una corsa di valutazione completa di Astra costa cinque cifre, a seconda della configurazione. Ma ARC Prize ha notato un problema controintuitivo: uno sforzo di ragionamento maggiore generalmente costa meno, perché Astra risolveva i giochi con meno azioni, riducendo il numero totale di chiamate di modello e di token bruciati per esecuzione.

Un modello che costruisce il proprio linguaggio

Al di là dei punteggi, ARC Prize ha evidenziato un comportamento qualitativo osservato dal team. Astra ha costantemente trasformato ambienti non familiari in modelli di mondo simbolici compatti, rappresentando le meccaniche di gioco come regole logiche e sviluppando una propria abbreviazione specifica del dominio per tenere traccia dello stato e pianificare le azioni.

Questa è esattamente l'abilità per cui ARC-AGI-3 è stato progettato. Laddove le precedenti generazioni del benchmark testavano il ragionamento fluido su nuovi modelli, la terza generazione verifica se un agente può esplorare, modellare, fissare obiettivi ed eseguire piani in ambienti che non ha mai visto: i componenti che ARC Prize elenca come esplorazione, modellazione, definizione degli obiettivi, pianificazione ed esecuzione.

Lo scenario dell'era AGI

I risultati del benchmark sono arrivati nel mezzo della massima retorica della stessa OpenAI. In una conferenza stampa prima del lancio di giovedì, il presidente della società Greg Brockman ha affermato che "non è irragionevole ritenere che ora siamo nell'era AGI", pur fermandosi prima di una dichiarazione formale, secondo la copertura del lancio di The New Stack. Ha descritto l'AGI come un "concetto di missione o concetto spirituale" piuttosto che come un fattore scatenante contrattuale.

Il ricercatore di OpenAI Aidan Clark ha affermato che Astra è stato il più grande corso di formazione dell'azienda fino ad oggi - il primo pre-addestrato su oltre 100.000 GPU presso il sito di Stargate in Texas - e la prima versione di OpenAI in cui i modelli precedenti hanno svolto un ruolo significativo nella supervisione del processo di formazione. L'accesso rimane graduale: il lancio inizia con i clienti aziendali nel programma Daybreak, con disponibilità Plus, Pro, Business ed Enterprise oltre all'accesso API e AWS promesso nei prossimi giorni.

L'asterisco sullo spartito

La cautela è d’obbligo su più fronti. Le prestazioni dell'ARC-AGI-3 di Astra dipendono fortemente dalla configurazione del cablaggio, come mostrano i due numeri nei titoli, e i cablaggi personalizzati che preservano lo stato del modello sono stati un punto di contesa ricorrente nelle controversie sui benchmark. L'analisi del lancio di New Stack ha rilevato che Astra "registra grandi guadagni su attività specializzate, ma ha un valore aggiunto e non guida chiaramente il pacchetto di codifica" - un promemoria che i benchmark dei puzzle agentici e i carichi di lavoro commerciali quotidiani misurano cose diverse.

Lo stesso ARC Prize inquadra l'esercizio come una misurazione del "divario residuo" tra l'attuale intelligenza artificiale e l'AGI, definendo l'AGI come la capacità di acquisire qualsiasi abilità che un essere umano può fare, con la stessa efficienza di un essere umano. Un punteggio quasi perfetto in condizioni favorevoli non colma tale divario da solo. E con un prezzo compreso tra 17.000 e 50.000 dollari per ogni ciclo di valutazione, solo i laboratori dotati di risorse adeguate possono permettersi di eseguire il benchmark su questa scala, anche se i dati sui costi di ARC Prize mostrano che un ragionamento più intelligente può effettivamente ridurre il conto.

Perché è importante

L’efficienza dell’azione è un parametro di paragone veramente nuovo. Un modello che risolve ogni livello ma spreca migliaia di chiamate per farlo è meno utile – e più costoso – di uno che agisce come ha fatto Astra in questo caso: esplorando deliberatamente, comprimendo ciò che apprende e agendo di conseguenza. Qualunque sia la conclusione del dibattito AGI, i dati dell’ARC Prize mostrano che gli agenti di frontiera ora stanno confrontando gli esseri umani non solo sulla capacità di risolvere nuovi problemi, ma su come li risolvono dal punto di vista economico.

Stai al passo con l'intelligenza artificiale

Ogni risultato del benchmark, lancio del modello e dibattito sulla sicurezza, monitorato mentre avviene - leggi altre notizie sull'intelligenza artificiale →