La società di benchmarking Artificial Analysis ha rilasciato la versione 4.2 del suo Intelligence Index il 4 settembre 2026, un aggiornamento provvisorio che rielabora il modo in cui vengono misurati i modelli di intelligenza artificiale di frontiera e, secondo la nuova classifica, Claude Fable 5.1 di Anthropic detiene il primo posto, con GPT-6 Astra di OpenAI al secondo posto dopo un guadagno di quattro punti rispetto a GPT-5.6 Sol.
L'aggiornamento arriva appena otto mesi dopo il lancio di Index v4 a gennaio, un'inversione di tendenza insolitamente rapida che l'azienda attribuisce al ritmo dei recenti rilasci di frontiera. "Con la frontiera che si è spostata così rapidamente nelle ultime settimane, riteniamo che sia importante fornire un aggiornamento provvisorio immediato per garantire che il nostro indice rimanga rilevante e utile come sempre", ha scritto la società nel suo annuncio.
Le classifiche principali
Secondo i risultati pubblicati, Claude Fable 5.1 di Anthropic guida l'indice, seguito da GPT-6 Astra di OpenAI, che ha migliorato di quattro punti rispetto a GPT-5.6 Sol. Meta è il terzo laboratorio più forte nella classifica, seguito da SpaceXAI, Moonshot/Kimi, Z.AI e Google.
Anthropic e OpenAI condividono anche il quadro aggiornato in termini di efficienza dei costi: le due società, insieme a Meta e Z.AI, occupano la frontiera di Pareto del "Costo per attività" dell'Indice, il che significa che nessun altro laboratorio attualmente offre un'intelligenza decisamente migliore allo stesso prezzo per attività completata.
Per quanto riguarda l'efficienza dei token, Artificial Analysis ha riscontrato che GPT-6 Astra "è più efficiente dei token di quasi ogni altro modello vicino alla frontiera dell'intelligenza", con Claude Fable 5.1, Grok 4.5 e Gemini 3.5 Flash-Lite seduti alle due estremità della curva. L’azienda ha osservato in un’analisi complementare, tuttavia, che il minor utilizzo dei token da parte di Astra è controbilanciato dai suoi prezzi più alti – un promemoria che l’efficienza pura e il costo totale non sempre vanno di pari passo.
Cosa è cambiato nella versione v4.2
Il cambiamento strutturale più significativo è una spinta deliberata contro i giochi di riferimento. Il quaranta per cento della ponderazione dell'indice proviene ora da set di test privati e tenuti a distanza (il doppio della quota nella v4.1) tra cui AA-Briefcase, AA-Omniscience e soluzioni per CritPt. L'azienda ha affermato che la cifra aumenterà ulteriormente nell'indice v5.
Due nuove valutazioni completano l'aggiornamento:
- AA-Briefcase, un benchmark interno del lavoro di conoscenza degli agenti con una serie di test privati. I modelli vengono valutati su progetti professionali di più settimane, ciascuno con molte attività collegate e migliaia di file di origine di input, e classificati attraverso una combinazione di punteggio di rubrica e confronto a coppie che copre il successo verificabile delle attività, la qualità analitica e la qualità della presentazione.
- GDP.pdf, creato da Surge AI, che testa il ragionamento a turno singolo su documenti professionali: 100 PDF che abbracciano dieci domini, con prove distribuite su 4.592 pagine di testo, tabelle, grafici e note a piè di pagina. Le risposte vengono valutate rispetto a 1.275 criteri atomici redatti da esperti e il titolo Tasso di superamento totale attribuisce un credito a un'attività solo quando ogni criterio è soddisfatto.
Un punto di riferimento di lunga data sta per scomparire: GPQA Diamond, il test di ragionamento scientifico a livello di laurea, è stato rimosso perché di fatto saturato da modelli di frontiera.
L'azienda ha inoltre aggiornato la propria infrastruttura di valutazione, rilasciando AA-LCR v1.1 con un nuovo sistema di valutazione rapido e chiavi di risposta corrette, riancorando la scala Elo per GDPval-AA v2 e AA-Briefcase in modo che le valutazioni rimangano stabili con l'arrivo di nuovi modelli e rafforzando i sandbox di valutazione di SciCode in modo che il codice lento ma corretto non venga più considerato un fallimento.
Cosa rivelano i nuovi test
I risultati delle nuove valutazioni offrono un quadro più granulare della posizione effettiva dei laboratori di frontiera.
Su AA-Briefcase, Claude Fable 5.1 e Opus 5 di Anthropic sono in testa, seguiti da GPT-6 Astra di OpenAI e Muse Spark 1.3 di Meta. GPT-6 Astra ottiene circa 85 punti Elo sopra GPT-5.6 Sol nella stessa valutazione: un salto sostanziale tra le successive generazioni di OpenAI.
Su GDP.pdf, il quadro si ribalta: OpenAI è in testa con GPT-6 Astra al 33,2% di tasso di passaggio totale, seguito da GPT-5.6 Sol al 28,2% e Claude Fable 5.1 al 26,2%. La divergenza suggerisce che la sintesi di documenti lunghi su contesti molto ampi rimane un punto di forza relativo per il modello più recente di OpenAI, anche se i modelli di Anthropic guidano l'indice generale e le attività di lavoro degli agenti.
Perché i set di test privati sono importanti
Lo spostamento verso una valutazione ritardata riflette un problema di credibilità più ampio nel benchmarking dell’IA. Poiché i modelli hanno assorbito più dati di test pubblici, i laboratori e gli osservatori indipendenti sono diventati sempre più preoccupati che i punteggi principali su benchmark ben noti riflettano la memorizzazione o la formazione mirata piuttosto che una reale capacità. Mantenendo privata una quota crescente dei suoi set di test e ponderandoli maggiormente, Artificial Analysis sta tentando di preservare il segnale che le classifiche pubbliche hanno perso.
L'azienda ha affermato di aver costruito elementi dell'Indice v5 "per mesi" e di aver deliberatamente trattenuto gli aggiornamenti per mantenere stabile l'indice durante la recente ondata di importanti lanci di modelli. Oltre alla versione provvisoria v4.2, prevede ulteriori aggiornamenti incrementali nel prossimo futuro man mano che viene completata la transizione v5.
Per gli acquirenti che scelgono tra i modelli di frontiera, il risultato pratico della v4.2 è che il top del mercato rimane una corsa a due cavalli tra Anthropic e OpenAI, con Meta che colma il divario – e che le valutazioni progettate per resistere ai giochi stanno ora facendo la maggior parte del lavoro di classificazione. Gli utenti che tengono traccia delle decisioni di selezione del modello possono seguire gli ultimi sviluppi dell'intelligenza artificiale con l'avvicinarsi del lancio della v5.
Stai al passo con l'intelligenza artificiale
Aggiornamenti dei benchmark come questo rimodellano il modo in cui il settore giudica i progressi. Leggi altre notizie sull'AI e rimani aggiornato su ogni rilascio di modello.
Leggi altre notizie sull'AI →