Firma benchmarkingowa Artificial Analysis opublikowała 4 września 2026 r. wersję 4.2 swojego Intelligence Index – tymczasową aktualizację, która zmienia sposób pomiaru pionierskich modeli sztucznej inteligencji. Według nowego zestawienia pierwsze miejsce zajmuje Claude Fable 5.1 firmy Anthropic, a drugie miejsce zajmuje GPT-6 Astra firmy OpenAI po czteropunktowej przewadze nad GPT-5.6 Sol.

Aktualizacja pojawia się zaledwie osiem miesięcy po premierze Index v4 w styczniu, a niezwykle szybki rozwój firma przypisuje tempu wydawania najnowszych, pionierskich wydań. „W związku z tym, że w ostatnich tygodniach granica przesuwała się tak szybko, uważamy, że ważne jest dostarczenie natychmiastowej tymczasowej aktualizacji, aby zapewnić, że nasz Indeks pozostanie tak samo istotny i użyteczny jak zawsze” – napisała spółka w swoim ogłoszeniu.

Rankingi nagłówków

Zgodnie z opublikowanymi wynikami, liderem indeksu jest Claude Fable 5.1 firmy Anthropic, a za nim plasuje się GPT-6 Astra firmy OpenAI, która poprawiła się o cztery punkty w stosunku do GPT-5.6 Sol. Meta jest trzecim najsilniejszym laboratorium w tabeli liderów, a za nim plasują się SpaceXAI, Moonshot/Kimi, Z.AI i Google.

Anthropic i OpenAI również podzielają zaktualizowany obraz efektywności kosztowej: obie firmy, wraz z Meta i Z.AI, plasują się na granicy Pareto „kosztu zadania” indeksu, co oznacza, że ​​żadne inne laboratorium nie oferuje obecnie dokładnie lepszej inteligencji za tę samą cenę za wykonane zadanie.

Jeśli chodzi o wydajność symboliczną, sztuczna analiza stwierdziła, że ​​GPT-6 Astra jest „bardziej wydajna niż prawie każdy inny model w pobliżu granicy wywiadu”, a Claude Fable 5.1, Grok 4.5 i Gemini 3.5 Flash-Lite znajdują się na obu końcach krzywej. Firma zauważyła jednak w towarzyszącej analizie, że mniejsze wykorzystanie tokenów Astry jest równoważone przez wyższe ceny, co przypomina, że ​​surowa wydajność i całkowity koszt nie zawsze idą w parze.

Co zmieniło się w wersji 4.2

Najbardziej znaczącą zmianą strukturalną jest celowe odejście od gier wzorcowych. Czterdzieści procent wagi Indeksu pochodzi obecnie z prywatnych, przechowywanych zestawów testowych – dwukrotnie więcej niż w wersji 4.1 – w tym AA-Briefcase, AA-Omniscience i rozwiązań dla CritPt. Firma stwierdziła, że ​​liczba ta wzrośnie jeszcze bardziej w Index v5.

Aktualizację potwierdzają dwie nowe oceny:

  • AA-Briefcase, wewnętrzny test porównawczy pracy opartej na wiedzy agentów z prywatnym zestawem testów. Modele są oceniane w ramach wielotygodniowych profesjonalnych projektów, każdy z wieloma połączonymi zadaniami i tysiącami wejściowych plików źródłowych, a następnie oceniane na podstawie kombinacji punktacji rubrykowej i porównania parami, obejmującego weryfikowalny sukces zadania, jakość analityczną i jakość prezentacji.
  • GDP.pdf, stworzony przez Surge AI, który testuje jednokierunkowe rozumowanie w profesjonalnych dokumentach: 100 plików PDF obejmujących dziesięć domen, z dowodami rozmieszczonymi na 4592 stronach tekstu, tabel, wykresów i przypisów. Odpowiedzi są oceniane na podstawie 1275 kryteriów atomowych opracowanych przez ekspertów, a nagłówek „Wskaźnik wszystkich zaliczeń” przypisuje zadanie tylko wtedy, gdy wszystkie kryteria zostaną spełnione.

Jeden z długoletnich punktów odniesienia odchodzi w niepamięć: GPQA Diamond, test rozumowania na poziomie nauk ścisłych dla absolwentów, został usunięty, ponieważ został skutecznie nasycony pionierskimi modelami.

Firma unowocześniła także swoją infrastrukturę oceniania, wypuszczając wersję 1.1 AA-LCR z nowym podpowiedzią systemu oceniania i poprawionymi kluczami odpowiedzi, ponownie zakotwiczając skalę Elo dla PKBval-AA v2 i AA-Briefcase, aby oceny pozostały stabilne w miarę pojawiania się nowych modeli, oraz wzmacniając piaskownice oceniające SciCode, tak aby powolny, ale poprawny kod nie był już uznawany za porażkę.

Co ujawniają nowe testy

Wyniki nowych ocen dają bardziej szczegółowy obraz sytuacji, w której faktycznie znajdują się laboratoria pionierskie.

W przypadku AA-Briefcase prym wiodą Claude Fable 5.1 i Opus 5 firmy Anthropic, a za nimi plasują się GPT-6 Astra firmy OpenAI i Muse Spark 1.3 firmy Meta. GPT-6 Astra uzyskuje w tej samej ocenie około 85 punktów Elo powyżej GPT-5.6 Sol, co stanowi znaczny przeskok pomiędzy kolejnymi generacjami OpenAI.

W pliku PKB.pdf obraz się odwraca: OpenAI prowadzi z GPT-6 Astra z współczynnikiem all-pass 33,2%, za nim plasuje się GPT-5.6 Sol z 28,2% i Claude Fable 5.1 z 26,2%. Rozbieżność sugeruje, że synteza długich dokumentów w bardzo dużych kontekstach pozostaje względną siłą najnowszego modelu OpenAI, nawet jeśli modele Anthropic przewodzą ogólnym zadaniom dotyczącym indeksu i pracy agenta.

Dlaczego prywatne zestawy testowe mają znaczenie

Przejście w stronę oceny wstrzymanej odzwierciedla szerszy problem wiarygodności w benchmarkingu sztucznej inteligencji. W miarę jak modele wchłaniały coraz więcej publicznych danych z testów, laboratoria i niezależni obserwatorzy coraz bardziej obawiali się, że główne wyniki w dobrze znanych testach odzwierciedlają zapamiętywanie lub ukierunkowane szkolenie, a nie rzeczywiste możliwości. Utrzymując coraz większą część swoich zestawów testowych w tajemnicy i przywiązując do nich większą wagę, Sztuczna Analiza próbuje zachować sygnał, że publiczne rankingi tracą.

Firma stwierdziła, że ​​„od miesięcy” tworzyła elementy Indeksu v5 i celowo wstrzymywała się z aktualizacjami, aby utrzymać stabilność Indeksu podczas ostatniej fali premier głównych modeli. Poza tymczasową wersją v4.2 planuje w najbliższej przyszłości więcej aktualizacji przyrostowych, po zakończeniu przejścia na v5.

Dla kupujących wybierających między pionierskimi modelami praktyczny wniosek z wersji 4.2 jest taki, że na szczycie rynku pozostaje wyścig dwóch koni pomiędzy Anthropic i OpenAI, przy czym Meta zmniejsza różnicę – i że oceny zaprojektowane tak, aby były odporne na gry, odgrywają teraz większą rolę w rankingu. Użytkownicy śledzący decyzje dotyczące wyboru modelu mogą śledzić najnowsze osiągnięcia AI w miarę zbliżania się wdrożenia wersji 5.

Wyprzedź sztuczną inteligencję

Aktualizacje testów porównawczych, takie jak ta, zmieniają sposób, w jaki branża ocenia postęp. Przeczytaj więcej aktualności o sztucznej inteligencji i bądź o krok przed każdym wydaniem modelu.

Przeczytaj więcej aktualności o sztucznej inteligencji →