Firma de analiză comparativă Artificial Analysis a lansat versiunea 4.2 a Indicelui său de inteligență pe 4 septembrie 2026, o actualizare intermediară care reproșează modul în care sunt măsurate modelele AI de frontieră – și, conform noului clasament, Claude Fable 5.1 de la Anthropic deține primul loc, cu GPT-6 OpenAI de la OpenAI pe locul doi, după un GPT-6 Astra de 4 puncte pe locul doi.

Actualizarea vine la doar opt luni după lansarea Index v4 în ianuarie, o redresare neobișnuit de rapidă pe care compania o atribuie ritmului recentelor lansări de frontieră. „În contextul în care frontiera s-a mutat atât de repede în ultimele săptămâni, considerăm că este important să oferim o actualizare intermediară imediată pentru a ne asigura că indicele nostru rămâne la fel de relevant și util ca niciodată”, a scris compania în anunțul său.

Clasamentul titlurilor

Conform rezultatelor publicate, Claude Fable 5.1 de la Anthropic conduce indexul, urmat de GPT-6 Astra de la OpenAI, care a îmbunătățit cu patru puncte față de GPT-5.6 Sol. Meta se clasează ca al treilea cel mai puternic laborator din clasament, urmat de SpaceXAI, Moonshot/Kimi, Z.AI și Google.

Anthropic și OpenAI împărtășesc, de asemenea, imaginea actualizată a eficienței costurilor: cele două companii, împreună cu Meta și Z.AI, ocupă frontiera Pareto a „Cost pe Sarcină” a Indexului, ceea ce înseamnă că niciun alt laborator nu oferă în prezent o inteligență strict mai bună pentru același preț pe sarcină finalizată.

În ceea ce privește eficiența token-ului, Artificial Analysis a constatat că GPT-6 Astra este „mai eficient token-ul decât aproape orice alt model din apropierea frontierei de inteligență”, cu Claude Fable 5.1, Grok 4.5 și Gemini 3.5 Flash-Lite la fiecare capăt al curbei. Firma a remarcat, totuși, într-o analiză însoțitoare, că utilizarea mai scăzută a token-ului de către Astra este depășită de prețurile sale mai mari - o amintire că eficiența brută și costul total nu se mișcă întotdeauna împreună.

Ce s-a schimbat în v4.2

Cea mai semnificativă schimbare structurală este o împingere deliberată împotriva jocurilor de referință. Patruzeci la sută din ponderea Indexului provine acum din seturi de testare private – dublu față de v4.1 – inclusiv AA-Briefcase, AA-Omniscience și soluții pentru CritPt. Firma a spus că această cifră va crește în continuare în Index v5.

Două noi evaluări ancorează actualizarea:

  • AA-Briefcase, un etalon intern de lucru pentru cunoștințe agentice cu un set de testare privat. Modelele sunt evaluate pe proiecte profesionale de mai multe săptămâni, fiecare cu multe sarcini legate și mii de fișiere sursă de intrare și sunt evaluate printr-o combinație de punctare rubrica și comparare în perechi care acoperă succesul verificabil al sarcinilor, calitatea analitică și calitatea prezentării.
  • GDP.pdf, creat de Surge AI, care testează raționamentul într-o singură tură în documente profesionale: 100 de PDF-uri care acoperă zece domenii, cu dovezi distribuite pe 4.592 de pagini de text, tabele, diagrame și note de subsol. Răspunsurile sunt evaluate în funcție de 1.275 de criterii atomice scrise de experți, iar titlul All-pass Rate creditează o sarcină numai atunci când fiecare criteriu este îndeplinit.

Un punct de referință de lungă durată este pe cale: GPQA Diamond, testul de raționament științific la nivel de absolvent, a fost eliminat deoarece a fost saturat efectiv de modele de frontieră.

Firma și-a îmbunătățit, de asemenea, infrastructura de clasificare, lansând AA-LCR v1.1 cu un nou sistem de clasificare prompt și chei de răspuns corectate, reancorând scara Elo pentru GDPval-AA v2 și AA-Briefcase, astfel încât evaluările să rămână stabile pe măsură ce sosesc noi modele și întărind box-urile de clasificare SciCode, astfel încât codul să nu mai corecteze, dar lent, dar corectează.

Ce dezvăluie noile teste

Rezultatele noilor evaluări oferă o imagine mai granulară a locului în care se află de fapt laboratoarele de frontieră.

Pe AA-Briefcase, Claude Fable 5.1 și Opus 5 de la Anthropic conduc, urmați de GPT-6 Astra de la OpenAI și Muse Spark 1.3 de la Meta. GPT-6 Astra obține aproximativ 85 de puncte Elo peste GPT-5.6 Sol la aceeași evaluare - un salt substanțial între generațiile succesive OpenAI.

Pe GDP.pdf, imaginea se inversează: OpenAI conduce cu GPT-6 Astra la 33,2% All-pass Rate, urmat de GPT-5.6 Sol la 28,2% și Claude Fable 5.1 la 26,2%. Divergența sugerează că sinteza de documente lungi în contexte foarte mari rămâne o forță relativă pentru cel mai nou model OpenAI, chiar dacă modelele lui Anthropic conduc indexul general și sarcinile de lucru agentice.

De ce contează seturile de teste private

Trecerea către o evaluare durabilă reflectă o problemă mai largă de credibilitate în benchmarkingul AI. Pe măsură ce modelele au absorbit mai multe date de testare publice, laboratoarele și observatorii independenți au devenit din ce în ce mai îngrijorați de faptul că scorurile principale ale benchmark-urilor binecunoscute reflectă mai degrabă memorarea sau antrenamentul direcționat decât capacitatea reală. Păstrând o parte din ce în ce mai mare din seturile sale de testare private și ponderând-le mai mult, Artificial Analysis încearcă să păstreze semnalul că clasamentele publice au pierdut.

Firma a spus că a construit elemente ale Index v5 „de luni de zile” și a reținut în mod deliberat actualizările pentru a menține Indexul stabil în timpul recentului val de lansări majore de modele. Dincolo de versiunea intermediară v4.2, planifică mai multe actualizări incrementale în viitorul apropiat, pe măsură ce finalizează tranziția v5.

Pentru cumpărătorii care aleg între modele de frontieră, concluzia practică de la v4.2 este că vârful pieței rămâne o cursă cu doi cai între Anthropic și OpenAI, Meta reducând diferența - și că evaluările concepute pentru a fi rezistente la jocuri fac acum o mai mare parte din munca de clasare. Utilizatorii care urmăresc deciziile de selecție a modelelor pot urmări cele mai recente evoluții AI pe măsură ce se apropie lansarea v5.

Rămâi înaintea AI

Actualizările de referință ca aceasta modifică modul în care industria judecă progresul. Citiți mai multe știri AI și rămâneți în fața fiecărei lansări de model.

Citiți mai multe știri AI →