4 вересня 2026 року компанія з порівняльного аналізу Artificial Analysis випустила версію 4.2 свого Індексу інтелекту, проміжне оновлення, яке переробляє методи вимірювання передових моделей штучного інтелекту — і, згідно з новою таблицею лідерів, Claude Fable 5.1 від Anthropic займає перше місце, а GPT-6 Astra від OpenAI на другому місці після випередження GPT-5.6 Sol на чотири пункти.

Оновлення з’явилося лише через вісім місяців після запуску Index v4 у січні, незвичайно швидкий поворот, який компанія пояснює швидкістю останніх передових випусків. «У зв’язку з тим, що останніми тижнями межі так швидко рухаються, ми вважаємо важливим негайно надати проміжне оновлення, щоб переконатися, що наш Індекс залишається таким же актуальним і корисним, як і раніше», — написала компанія у своєму повідомленні.

Рейтинг заголовків

Відповідно до опублікованих результатів, Claude Fable 5.1 від Anthropic лідирує в Індексі, за ним йде GPT-6 Astra від OpenAI, який покращив на чотири бали GPT-5.6 Sol. Meta посідає третю найсильнішу лабораторію в таблиці лідерів, за нею йдуть SpaceXAI, Moonshot/Kimi, Z.AI і Google.

Anthropic і OpenAI також поділяють оновлену картину економічної ефективності: дві компанії разом із Meta та Z.AI займають рубіж Парето в Індексі «Вартість за завдання», тобто жодна інша лабораторія наразі не пропонує абсолютно кращих інтелектуальних даних за ту саму ціну за виконане завдання.

Що стосується ефективності токенів, Artificial Analysis виявив, що GPT-6 Astra «більш ефективний за токени, ніж майже будь-яка інша модель поблизу кордону інтелекту», з Claude Fable 5.1, Grok 4.5 і Gemini 3.5 Flash-Lite, що знаходяться на обох кінцях кривої. Однак у супутньому аналізі фірма зазначила, що нижче використання токенів Astra переважує її вищі ціни — це нагадування про те, що ефективність і загальна вартість не завжди співпадають.

Що змінилося у v4.2

Найсуттєвішою структурною зміною є навмисний поштовх проти еталонних ігор. Сорок відсотків ваги Індексу тепер походить від приватних тестових наборів — подвоєна частка у версії 4.1 — включаючи AA-Briefcase, AA-Omniscience та рішення для CritPt. Фірма заявила, що ця цифра ще зросте в Index v5.

Дві нові оцінки закріплюють оновлення:

  • AA-Briefcase, власний контрольний тест агентської роботи з приватним набором тестів. Моделі оцінюються в багатотижневих професійних проектах, кожен з яких містить багато пов’язаних завдань і тисячі вихідних файлів вхідних даних, і оцінюються за допомогою комбінації балів за рубриками та попарного порівняння, що охоплює перевірений успіх виконання завдань, аналітичну якість і якість презентації.
  • GDP.pdf, створений Surge AI, який перевіряє одноповоротні міркування в професійних документах: 100 PDF-файлів, що охоплюють десять доменів, із доказами, розподіленими на 4592 сторінках тексту, таблиць, діаграм і виносок. Відповіді оцінюються за 1275 атомарними критеріями, створеними експертами, а заголовок All-pass Rate зараховує завдання лише тоді, коли всі критерії задоволені.

Один давній еталон скоро закінчується: GPQA Diamond, тест на наукове міркування для випускників, було видалено, оскільки він був фактично насичений граничними моделями.

Фірма також оновила свою інфраструктуру оцінювання, випустивши AA-LCR v1.1 з новою підказкою системи оцінювання та виправленими ключами відповідей, повторно закріпивши шкалу Elo для GDPval-AA v2 і AA-Briefcase, щоб рейтинги залишалися стабільними, коли надходять нові моделі, і посиливши пісочниці оцінювання SciCode, щоб повільний, але правильний код більше не вважався невдалим.

Що показують нові тести

Результати нових оцінок пропонують більш детальну картину того, де насправді знаходяться передові лабораторії.

На AA-Briefcase лідирують Claude Fable 5.1 і Opus 5 від Anthropic, за ними йдуть GPT-6 Astra від OpenAI і Muse Spark 1.3 від Meta. GPT-6 Astra набирає приблизно на 85 балів Elo вище GPT-5.6 Sol за тим самим оцінюванням — значний стрибок між наступними поколіннями OpenAI.

У GDP.pdf картина змінюється: OpenAI лідирує з GPT-6 Astra із показником All-Pass 33,2%, за ним йдуть GPT-5.6 Sol із 28,2% і Claude Fable 5.1 із 26,2%. Розбіжність свідчить про те, що синтез довгих документів у дуже великих контекстах залишається відносною перевагою для найновішої моделі OpenAI, навіть якщо моделі Anthropic лідирують у загальних завданнях індексування та агентської роботи.

Чому приватні набори тестів важливі

Перехід у бік відкладеної оцінки відображає ширшу проблему довіри до бенчмаркінгу ШІ. У міру того, як моделі поглинали більше загальнодоступних тестових даних, лабораторії та незалежні спостерігачі дедалі більше занепокоєні тим, що заголовні результати загальновідомих тестів відображають запам’ятовування або цілеспрямоване навчання, а не справжні здібності. Зберігаючи все більшу частку своїх наборів тестів приватними та зважуючи їх більш серйозно, Artificial Analysis намагається зберегти сигнал про те, що загальнодоступні таблиці лідерів втрачають.

Фірма заявила, що створювала елементи Index v5 «протягом місяців» і навмисно затримувала оновлення, щоб зберегти стабільність Index під час недавньої хвилі запуску великих моделей. Крім проміжного випуску v4.2, він планує більше поступових оновлень у найближчому майбутньому після завершення переходу на v5.

Для покупців, які обирають між передовими моделями, практичний висновок версії 4.2 полягає в тому, що вершина ринку залишається змаганням двох коней між Anthropic і OpenAI, причому Meta скорочує розрив — і що оцінки, розроблені для стійкості до ігор, тепер виконують більше рейтингової роботи. Користувачі, які відстежують рішення щодо вибору моделі, можуть стежити за останніми розробками штучного інтелекту з наближенням випуску v5.

Будьте попереду ШІ

Оновлення тестів, подібні до цього, змінюють те, як галузь оцінює прогрес. Читайте більше новин AI і будьте попереду кожного випуску моделі.

Читати більше новин AI →