Srovnávací společnost Artificial Analysis vydala 4. září 2026 verzi 4.2 svého indexu inteligence, prozatímní aktualizaci, která přepracovává způsob měření hraničních modelů umělé inteligence – a podle nového žebříčku drží první příčku Claude Fable 5.1 od Anthropic s GPT-6 Astra od OpenAI na druhém místě po zisku GPT 5-5 bodů.

Aktualizace přichází pouhých osm měsíců po uvedení Index v4 v lednu, což je neobvykle rychlý obrat, který firma připisuje tempu nedávných vydání na hranici. "Vzhledem k tomu, že se hranice v posledních týdnech posouvají tak rychle, cítíme, že je důležité poskytnout okamžitou prozatímní aktualizaci, abychom zajistili, že náš index zůstane stejně relevantní a užitečný jako kdykoli předtím," napsala společnost ve svém oznámení.

Hlavní žebříček

Podle zveřejněných výsledků vede index Anthropic Claude Fable 5.1 následovaný OpenAI GPT-6 Astra, který si polepšil o čtyři body oproti GPT-5.6 Sol. Meta je třetí nejsilnější laboratoří v žebříčku, následuje SpaceXAI, Moonshot/Kimi, Z.AI a Google.

Antropic a OpenAI také sdílejí aktualizovaný obrázek o nákladové efektivitě: obě společnosti, spolu s Meta a Z.AI, zaujímají Paretovu hranici indexu „Cost per Task“, což znamená, že žádná jiná laboratoř v současnosti nenabízí striktně lepší inteligenci za stejnou cenu za dokončený úkol.

Pokud jde o efektivitu tokenů, umělá analýza zjistila, že GPT-6 Astra je „efektivnější tokeny než téměř všechny ostatní modely poblíž hranic inteligence“, přičemž Claude Fable 5.1, Grok 4.5 a Gemini 3.5 Flash-Lite sedí na obou koncích křivky. Společnost však v doprovodné analýze poznamenala, že nižší využití tokenů Astra je vyváženo jejími vyššími cenami – což je připomínkou toho, že hrubá efektivita a celkové náklady nejdou vždy dohromady.

Co se změnilo ve verzi 4.2

Nejvýznamnější strukturální změnou je záměrný tlak na benchmarkové hraní. Čtyřicet procent váhy Indexu nyní pochází ze soukromých, odložených testovacích sad – dvojnásobek podílu ve verzi 4.1 – včetně AA-Briefcase, AA-Omniscience a řešení pro CritPt. Firma uvedla, že v Indexu v5 toto číslo dále poroste.

Aktualizaci ukotvují dvě nová hodnocení:

  • AA-Briefcase, interní pracovní benchmark agentních znalostí se sadou soukromých testů. Modely jsou hodnoceny na vícetýdenních profesionálních projektech, každý s mnoha propojenými úkoly a tisíci vstupních zdrojových souborů, a klasifikovány pomocí kombinace bodování rubrik a párového porovnávání pokrývajícího ověřitelnou úspěšnost úkolu, analytickou kvalitu a kvalitu prezentace.
  • GDP.pdf, vytvořený společností Surge AI, která testuje uvažování jedním otočením napříč profesionálními dokumenty: 100 souborů PDF zahrnujících deset domén s důkazy distribuovanými na 4 592 stránkách textu, tabulek, grafů a poznámek pod čarou. Odpovědi jsou hodnoceny podle 1 275 atomových kritérií vytvořených odborníky a titulek All-pass Rate (Hodnota pro všechny úspěšné) připisuje úkol pouze v případě, že je splněno každé kritérium.

Jedno dlouhotrvající měřítko je na cestě ven: GPQA Diamond, test vědeckého uvažování na úrovni absolventů, byl odstraněn, protože byl účinně nasycen hraničními modely.

Společnost také upgradovala svou infrastrukturu hodnocení, vydala AA-LCR v1.1 s novým systémem rychlého hodnocení a opravenými klíči odpovědí, znovu ukotvila stupnici Elo pro GDPval-AA v2 a AA-Briefcase, aby hodnocení zůstala stabilní, když přicházejí nové modely, a zpevnila karantény hodnocení SciCode, aby se pomalý, ale správný kód již nepočítal jako chybný kód.

Co odhalují nové testy

Výsledky nových hodnocení nabízejí podrobnější obrázek o tom, kde se hraniční laboratoře skutečně nacházejí.

Na AA-Briefcase vedou Claude Fable 5.1 a Opus 5 od Anthropic, následované GPT-6 Astra od OpenAI a Muse Spark 1.3 od Meta. GPT-6 Astra dosahuje při stejném hodnocení zhruba 85 bodů Elo nad GPT-5.6 Sol – významný skok mezi po sobě jdoucími generacemi OpenAI.

Na GDP.pdf se obrázek obrací: OpenAI vede s GPT-6 Astra s 33,2 % All-pass Rate, následuje GPT-5.6 Sol s 28,2 % a Claude Fable 5.1 s 26,2 %. Divergence naznačuje, že syntéza dlouhých dokumentů ve velmi rozsáhlých kontextech zůstává relativní silou nejnovějšího modelu OpenAI, i když modely Anthropic vedou celkový index a úkoly agentů.

Proč záleží na soukromých testovacích sadách

Posun směrem k odloženému hodnocení odráží širší problém důvěryhodnosti v benchmarkingu AI. Vzhledem k tomu, že modely absorbovaly více dat z veřejných testů, laboratoře a nezávislí pozorovatelé se stále více obávají, že hlavní skóre ve známých měřítcích odrážejí zapamatování nebo cílený trénink spíše než skutečné schopnosti. Umělá analýza tím, že udržuje rostoucí podíl svých testovacích sad v soukromí a přikládá jim větší váhu, snaží se zachovat signál, že veřejné žebříčky ztrácejí.

Firma uvedla, že stavěla prvky Indexu v5 „po celé měsíce“ a záměrně zadržovala aktualizace, aby udržela index stabilní během nedávné vlny uvedení hlavních modelů. Kromě prozatímního vydání v4.2 plánuje v blízké budoucnosti další přírůstkové aktualizace, protože dokončuje přechod na v5.

Pro kupující, kteří si vybírají mezi hraničními modely, je praktickým přínosem z verze 4.2 to, že špička trhu zůstává závodem dvou koní mezi Anthropic a OpenAI, přičemž Meta zaceluje mezeru – a že hodnocení navržená tak, aby byla odolná vůči hraní, nyní dělají více práce v hodnocení. Uživatelé sledující rozhodnutí o výběru modelu mohou sledovat nejnovější vývoj umělé inteligence, jak se blíží zavádění v5.

Udržujte si náskok před AI

Aktualizace srovnávacích testů, jako je tato, přetvářejí pokrok v oboru soudců. Přečtěte si další zprávy o AI a zůstaňte napřed před každým vydáním modelu.

Přečtěte si další zprávy o AI →