Benchmarkingföretaget Artificial Analysis släppte version 4.2 av sitt Intelligence Index den 4 september 2026, en interimsuppdatering som omarbetar hur frontier AI-modeller mäts — och enligt den nya topplistan har Anthropics Claude Fable 5.1 topplaceringen, med OpenAI:s GPT-6 Astra på andra plats efter en GPT-6 Astra.6 med fyra poäng.
Uppdateringen kommer bara åtta månader efter att Index v4 lanserades i januari, en ovanligt snabb vändning som företaget tillskriver takten i de senaste gränssläppen. "Med gränsen som rört sig så snabbt under de senaste veckorna känner vi att det är viktigt att leverera en omedelbar interimsuppdatering för att säkerställa att vårt index förblir lika relevant och användbart som någonsin", skrev företaget i sitt tillkännagivande.
Rubrikrankingen
Enligt de publicerade resultaten leder Anthropics Claude Fable 5.1 indexet, följt av OpenAI:s GPT-6 Astra, som förbättrade fyra poäng jämfört med GPT-5.6 Sol. Meta rankas som det tredje starkaste labbet på topplistan, följt av SpaceXAI, Moonshot/Kimi, Z.AI och Google.
Anthropic och OpenAI delar också den uppdaterade kostnadseffektivitetsbilden: de två företagen, tillsammans med Meta och Z.AI, upptar indexets "Cost per Task" Pareto-gräns, vilket innebär att inget annat labb för närvarande erbjuder strikt bättre intelligens för samma pris per genomförd uppgift.
När det gäller tokeneffektivitet fann artificiell analys GPT-6 Astra "mer tokeneffektiv än nästan alla andra modeller nära intelligensgränsen", med Claude Fable 5.1, Grok 4.5 och Gemini 3.5 Flash-Lite i vardera änden av kurvan. Företaget noterade dock i en kompletterande analys att Astras lägre tokenanvändning uppvägs av dess högre priser – en påminnelse om att råeffektivitet och totalkostnad inte alltid går ihop.
Vad ändrades i v4.2
Den mest betydande strukturella förändringen är en medveten push mot benchmarkspel. Fyrtio procent av indexets viktning kommer nu från privata, uthållna testset – dubbelt så stor andel i v4.1 – inklusive AA-portfölj, AA-Omniscience och lösningar för CritPt. Företaget sa att siffran kommer att stiga ytterligare i Index v5.
Två nya utvärderingar förankrar uppdateringen:
- AA-portföljen, ett internt riktmärke för agentkunskapsarbete med ett privat testset. Modeller utvärderas på flera veckors professionella projekt, var och en med många länkade uppgifter och tusentals indatakällfiler, och graderas genom en kombination av rubrikpoäng och parvis jämförelse som täcker verifierbar uppgiftsframgång, analytisk kvalitet och presentationskvalitet.
- GDP.pdf, skapad av Surge AI, som testar enkelvarvsresonemang över professionella dokument: 100 PDF-filer som spänner över tio domäner, med bevis fördelade på 4 592 sidor med text, tabeller, diagram och fotnoter. Svaren graderas mot 1 275 expertförfattade atomkriterier, och rubriken All-pass Rate tillskriver en uppgift endast när varje kriterium är uppfyllt.
Ett långvarigt riktmärke är på väg ut: GPQA Diamond, det vetenskapliga resonemangstestet på forskarnivå, har tagits bort eftersom det effektivt har mättats av frontier-modeller.
Företaget uppgraderade också sin graderingsinfrastruktur, släppte AA-LCR v1.1 med en ny graderingssystems prompt och korrigerade svarsnycklar, förankrade Elo-skalan för GDPval-AA v2 och AA-Portföljen så att betygen förblir stabila när nya modeller anländer, och härdade SciCodes graderingssandlådor som inte längre räknas som ett misslyckande.
Vad de nya testerna avslöjar
Resultaten från de nya utvärderingarna ger en mer detaljerad bild av var frontier labs faktiskt står.
På AA-portföljen leder Anthropics Claude Fable 5.1 och Opus 5, följt av OpenAI:s GPT-6 Astra och Metas Muse Spark 1.3. GPT-6 Astra får ungefär 85 Elo-poäng över GPT-5.6 Sol på samma utvärdering – ett betydande hopp mellan successiva OpenAI-generationer.
På GDP.pdf vänder bilden: OpenAI leder med GPT-6 Astra med 33,2 % All-pass Rate, följt av GPT-5,6 Sol med 28,2 % och Claude Fable 5,1 med 26,2 %. Avvikelsen tyder på att syntes av långa dokument över mycket stora sammanhang förblir en relativ styrka för OpenAI:s nyaste modell, även när Anthropics modeller leder det övergripande indexet och agenternas arbetsuppgifter.
Varför privata testset spelar roll
Förskjutningen mot uthållig utvärdering speglar ett bredare trovärdighetsproblem inom AI-benchmarking. I takt med att modeller har absorberat mer offentliga testdata, har laboratorier och oberoende observatörer blivit allt mer oroliga för att rubrikbetyg på välkända riktmärken återspeglar memorering eller riktad träning snarare än genuin förmåga. Genom att hålla en växande andel av sina testset privata och väga dem tyngre, försöker artificiell analys bevara signalen om att offentliga topplistor har tappat.
Företaget sa att det har byggt upp delar av Index v5 "i månader" och medvetet hållit tillbaka uppdateringar för att hålla indexet stabilt genom den senaste vågen av stora modelllanseringar. Utöver den interimistiska versionen av v4.2 planerar den fler inkrementella uppdateringar inom en snar framtid när den slutför v5-övergången.
För köpare som väljer mellan gränsmodeller är det praktiska avdraget från v4.2 att toppen av marknaden förblir ett tvåhästslopp mellan Anthropic och OpenAI, med Meta som minskar gapet – och att utvärderingarna som utformats för att vara motståndskraftiga mot spel nu gör mer av rankningsarbetet. Användare som spårar modellvalsbeslut kan följa den senaste AI-utvecklingen när v5-utbyggnaden närmar sig.
Ligg före AI
Benchmarkuppdateringar som denna omformar hur branschen bedömer framsteg. Läs fler AI-nyheter och håll dig före varje modellsläpp.
Läs mer AI-nyheter →