Benchmarkbedrijf Artificial Analysis heeft op 4 september 2026 versie 4.2 van zijn Intelligence Index uitgebracht, een tussentijdse update die herwerkt hoe grensverleggende AI-modellen worden gemeten – en volgens het nieuwe klassement staat Claude Fable 5.1 van Anthropic op de eerste plaats, met OpenAI's GPT-6 Astra op de tweede plaats na een winst van vier punten ten opzichte van GPT-5.6 Sol.

De update komt slechts acht maanden na de lancering van Index v4 in januari, een ongewoon snelle ommekeer die het bedrijf toeschrijft aan het tempo van recente grensreleases. “Nu de grens de afgelopen weken zo snel is verschoven, vinden we het belangrijk om onmiddellijk een tussentijdse update uit te brengen om ervoor te zorgen dat onze Index net zo relevant en nuttig blijft als altijd”, schreef het bedrijf in zijn aankondiging.

De kopranglijst

Volgens de gepubliceerde resultaten leidt Claude Fable 5.1 van Anthropic de Index, gevolgd door GPT-6 Astra van OpenAI, die vier punten verbeterde ten opzichte van GPT-5.6 Sol. Meta staat op de derde plaats op de ranglijst van sterkste labs, gevolgd door SpaceXAI, Moonshot/Kimi, Z.AI en Google.

Anthropic en OpenAI delen ook het bijgewerkte beeld van de kostenefficiëntie: de twee bedrijven bezetten, samen met Meta en Z.AI, de Pareto-grens van de Index op het gebied van "kosten per taak", wat betekent dat geen enkel ander laboratorium momenteel strikt betere intelligentie biedt voor dezelfde prijs per voltooide taak.

Wat token-efficiëntie betreft, vond Artificial Analysis dat GPT-6 Astra "token-efficiënter is dan bijna elk ander model in de buurt van de intelligentiegrens", met Claude Fable 5.1, Grok 4.5 en Gemini 3.5 Flash-Lite aan beide uiteinden van de curve. Het bedrijf merkte echter in een begeleidende analyse op dat het lagere tokengebruik van Astra wordt gecompenseerd door de hogere prijzen – een herinnering dat ruwe efficiëntie en totale kosten niet altijd samengaan.

Wat is er veranderd in v4.2

De belangrijkste structurele verandering is een doelbewuste druk tegen benchmark-gaming. Veertig procent van de weging van de Index is nu afkomstig van particuliere, langdurige testsets – het dubbele van het aandeel in v4.1 – inclusief AA-Briefcase, AA-Omniscience en oplossingen voor CritPt. Het bedrijf zei dat dit cijfer verder zal stijgen in Index v5.

Twee nieuwe evaluaties verankeren de update:

  • AA-Briefcase, een interne benchmark voor kenniswerk van agenten met een privé-testset. Modellen worden geëvalueerd op professionele projecten van meerdere weken, elk met veel gekoppelde taken en duizenden invoerbronbestanden, en beoordeeld door een combinatie van rubriekscores en paarsgewijze vergelijking die betrekking hebben op verifieerbaar taaksucces, analytische kwaliteit en presentatiekwaliteit.
  • GDP.pdf, gemaakt door Surge AI, dat de redenering in één keer in professionele documenten test: 100 pdf's verspreid over tien domeinen, met bewijsmateriaal verdeeld over 4.592 pagina's tekst, tabellen, grafieken en voetnoten. Reacties worden beoordeeld op basis van 1.275 door experts geschreven atomaire criteria, en de kop All-pass Rate crediteert een taak alleen als aan elk criterium is voldaan.

Eén al lang bestaande benchmark is aan het verdwijnen: GPQA Diamond, de test voor wetenschappelijk redeneren op graduate niveau, is verwijderd omdat deze feitelijk verzadigd is door grensmodellen.

Het bedrijf heeft ook zijn beoordelingsinfrastructuur geüpgraded, door AA-LCR v1.1 uit te brengen met een nieuwe beoordelingssysteemprompt en gecorrigeerde antwoordsleutels, de Elo-schaal voor GDPval-AA v2 en AA-Briefcase opnieuw te verankeren, zodat de beoordelingen stabiel blijven als er nieuwe modellen arriveren, en de beoordelingssandboxen van SciCode te versterken, zodat langzame maar correcte code niet langer als een mislukking telt.

Wat de nieuwe tests onthullen

De resultaten van de nieuwe evaluaties bieden een gedetailleerder beeld van waar de grenslaboratoria daadwerkelijk staan.

Op AA-Briefcase leiden Claude Fable 5.1 en Opus 5 van Anthropic, gevolgd door OpenAI's GPT-6 Astra en Meta's Muse Spark 1.3. GPT-6 Astra scoort ongeveer 85 Elo-punten boven GPT-5.6 Sol op dezelfde evaluatie – een aanzienlijke sprong tussen opeenvolgende OpenAI-generaties.

Op GDP.pdf draait het beeld om: OpenAI leidt met GPT-6 Astra met een All-pass Rate van 33,2%, gevolgd door GPT-5.6 Sol met 28,2% en Claude Fable 5.1 met 26,2%. Het verschil suggereert dat de synthese van lange documenten over zeer grote contexten een relatieve kracht blijft voor het nieuwste model van OpenAI, ook al leiden de modellen van Anthropic de algemene index- en agentische werktaken.

Waarom privétestsets ertoe doen

De verschuiving naar uitgestelde evaluatie weerspiegelt een breder geloofwaardigheidsprobleem bij AI-benchmarking. Naarmate modellen meer openbare testgegevens hebben geabsorbeerd, zijn laboratoria en onafhankelijke waarnemers zich steeds meer zorgen gaan maken dat de kernscores op bekende benchmarks een weerspiegeling zijn van memorisatie of gerichte training in plaats van echte capaciteiten. Door een groeiend deel van de testsets privé te houden en zwaarder te wegen, probeert Artificial Analysis het signaal te behouden dat de publieke klassementen aan het verliezen zijn.

Het bedrijf zei dat het "maandenlang" elementen van Index v5 heeft opgebouwd en opzettelijk updates achterhield om de Index stabiel te houden tijdens de recente golf van grote modellanceringen. Naast de tussentijdse versie van v4.2 plant het in de nabije toekomst meer incrementele updates naarmate de overgang naar v5 wordt voltooid.

Voor kopers die kiezen tussen frontier-modellen is de praktische conclusie van v4.2 dat de top van de markt een race tussen twee paarden blijft tussen Anthropic en OpenAI, waarbij Meta de kloof overbrugt – en dat de evaluaties die zijn ontworpen om resistent te zijn tegen gaming nu meer van het rankingwerk doen. Gebruikers die beslissingen over modelselectie volgen, kunnen de nieuwste AI-ontwikkelingen volgen naarmate de uitrol van v5 nadert.

Blijf AI een stap voor

Benchmarkupdates zoals deze veranderen de manier waarop de sector vooruitgang beoordeelt. Lees meer AI-nieuws en blijf op de hoogte van elke modelrelease.

Lees meer AI-nieuws →