4 сентября 2026 года компания Artificial Analysis выпустила версию 4.2 своего индекса интеллекта, промежуточное обновление, которое меняет способ измерения передовых моделей ИИ — и, согласно новой таблице лидеров, Claude Fable 5.1 от Anthropic занимает первое место, а GPT-6 Astra от OpenAI находится на втором месте после преимущества на четыре пункта над GPT-5.6 Sol.

Обновление появилось всего через восемь месяцев после запуска Index v4 в январе, и компания объясняет необычно быстрый поворот темпами недавних передовых выпусков. «Поскольку в последние недели граница смещается так быстро, мы считаем важным немедленно предоставить промежуточное обновление, чтобы наш индекс оставался таким же актуальным и полезным, как и прежде», — написала компания в своем объявлении.

Заголовок рейтинга

Согласно опубликованным результатам, индекс Claude Fable 5.1 от Anthropic возглавляет, за ним следует GPT-6 Astra от OpenAI, который улучшился на четыре пункта по сравнению с GPT-5.6 Sol. Meta занимает третье место в таблице лидеров, за ней следуют SpaceXAI, Moonshot/Kimi, Z.AI и Google.

Anthropic и OpenAI также разделяют обновленную картину экономической эффективности: эти две компании вместе с Meta и Z.AI занимают границу Парето индекса «Цена за задачу», а это означает, что ни одна другая лаборатория в настоящее время не предлагает строго лучший интеллект за ту же цену за выполненную задачу.

Что касается эффективности токенов, Искусственный анализ обнаружил, что GPT-6 Astra «более эффективен, чем почти любая другая модель, находящаяся на границе интеллекта», причем Claude Fable 5.1, Grok 4.5 и Gemini 3.5 Flash-Lite находятся на обоих концах кривой. Однако в сопутствующем анализе фирма отметила, что более низкое использование токенов Astra перевешивается их более высокими ценами — напоминание о том, что чистая эффективность и общие затраты не всегда движутся вместе.

Что изменилось в версии 4.2

Самым значительным структурным изменением является намеренный отказ от эталонных игр. Сорок процентов веса Индекса теперь приходится на частные, отложенные наборы тестов (вдвое больше, чем в версии 4.1), включая AA-Briefcase, AA-Всезнание и решения для CritPt. Фирма заявила, что в индексе v5 эта цифра будет расти и дальше.

Обновление закреплено двумя новыми оценками:

  • AA-Briefcase, собственный эталон работы с агентскими знаниями с частным набором тестов. Модели оцениваются в рамках многонедельных профессиональных проектов, каждый из которых включает множество связанных задач и тысячи входных исходных файлов, и оцениваются с помощью комбинации оценки по критериям и парного сравнения, охватывающего поддающийся проверке успех выполнения задач, аналитическое качество и качество презентации.
  • GDP.pdf, созданный Surge AI, который проверяет одноэтапные рассуждения в профессиональных документах: 100 PDF-файлов, охватывающих десять областей, с доказательствами, распределенными по 4592 страницам текста, таблицам, диаграммам и сноскам. Ответы оцениваются по 1275 атомарным критериям, созданным экспертами, а в заголовке «Процент всех проходов» задача засчитывается только в том случае, если каждый критерий удовлетворен.

Один из давних эталонов скоро уйдет: GPQA Diamond, тест на научное мышление для выпускников, был удален, поскольку он был фактически насыщен передовыми моделями.

Фирма также модернизировала свою инфраструктуру выставления оценок, выпустив AA-LCR v1.1 с новой системой выставления оценок и ключами исправленных ответов, повторно привязав шкалу Эло для GDPval-AA v2 и AA-Briefcase, чтобы рейтинги оставались стабильными по мере появления новых моделей, и укрепив песочницы выставления оценок SciCode, чтобы медленный, но правильный код больше не считался неудачным.

Что показывают новые тесты

Результаты новых оценок дают более детальную картину того, где на самом деле находятся передовые лаборатории.

В рейтинге AA-Briefcase лидируют Claude Fable 5.1 и Opus 5 от Anthropic, за ними следуют GPT-6 Astra от OpenAI и Muse Spark 1.3 от Meta. GPT-6 Astra набирает примерно 85 баллов Elo выше GPT-5.6 Sol по той же оценке — существенный скачок между последовательными поколениями OpenAI.

В GDP.pdf картина меняется: OpenAI лидирует с GPT-6 Astra с коэффициентом полного прохождения 33,2%, за ним следуют GPT-5.6 Sol с 28,2% и Claude Fable 5.1 с 26,2%. Расхождение предполагает, что синтез длинных документов в очень больших контекстах остается относительно сильной стороной новейшей модели OpenAI, даже несмотря на то, что модели Anthropic лидируют в общих задачах индексации и агентной работы.

Почему важны частные тестовые наборы

Сдвиг в сторону отсроченной оценки отражает более широкую проблему доверия к сравнительному анализу ИИ. Поскольку модели поглощают все больше данных общедоступных испытаний, лаборатории и независимые наблюдатели все больше обеспокоены тем, что заголовки оценок по известным тестам отражают запоминание или целенаправленное обучение, а не подлинные способности. Сохраняя конфиденциальность растущей доли своих тестовых наборов и придавая им более высокий вес, Artificial Analysis пытается сохранить сигнал о том, что публичные таблицы лидеров теряются.

Фирма заявила, что создавала элементы Index v5 «в течение нескольких месяцев» и намеренно сдерживала обновления, чтобы поддерживать стабильность индекса во время недавней волны запуска крупных моделей. Помимо промежуточного выпуска версии 4.2, в ближайшем будущем компания планирует дополнительные дополнительные обновления по мере завершения перехода на версию 5.

Для покупателей, выбирающих между передовыми моделями, практический вывод из версии 4.2 заключается в том, что вершина рынка остается в гонке двух лошадей между Anthropic и OpenAI, а Meta сокращает разрыв - и что оценки, разработанные с учетом устойчивости к играм, теперь выполняют большую часть ранжирующей работы. Пользователи, отслеживающие решения по выбору модели, могут следить за последними разработками в области искусственного интеллекта по мере приближения развертывания версии 5.

Будьте впереди ИИ

Обновления эталонных показателей, подобные этому, меняют то, как отрасль оценивает прогресс. Читайте больше новостей об искусственном интеллекте и будьте в курсе выпуска каждой модели.

Читать больше новостей об искусственном интеллекте →