Новый эталон бросает вызов тому, как индустрия искусственного интеллекта измеряет научные возможности, и его первые результаты унизительны для передовых лабораторий. Терминал-Bench-Science 0.1, запущенный на этой неделе исследователями из Стэнфордского университета и командой, стоящей за популярным тестом кодирования Terminal-Bench, оценивает ИИ-агентов в реальных рабочих процессах научных исследований, предоставленных работающими учеными, а самая мощная протестированная модель, Claude Opus 5, работающая через Claude Code, выполнила только 30% задач.

На странице объявления теста прямо описан его руководящий принцип: ученые, а не разработчики моделей или поставщики данных, должны устанавливать планку научных возможностей в области ИИ. Проект был создан в сотрудничестве с экспертами из исследовательских институтов по всему миру, и его первый выпуск включает в себя 70 задач, охватывающих науки о жизни, физику, науки о Земле, математику и инженерию.

Чем он отличается от тестов из учебников

Большинство научных оценок ИИ проверяют знания: вопросы с несколькими вариантами ответов, задачи из учебников, стандартизированные упражнения. Вместо этого Terminal-Bench-Science измеряет, могут ли агенты выполнять технически сложные и трудоемкие рабочие процессы, которые заполняют дни настоящих исследователей — вид работы, которая не появляется ни на одном экзамене. Задачи выполняются в реалистичных средах, а выставление оценок основано на конкретных артефактах: анализе, моделировании, доказательствах, коде и продуктах данных, проверенных с помощью воспроизводимых тестов для конкретных задач, а не на моделях оценки или оценке с несколькими вариантами ответов.

Этот дизайн отражает теорию о том, что помощники ИИ в конечном итоге должны делать для науки. Авторы теста утверждают, что вместо того, чтобы заменять научные суждения, агенты должны взять на себя уровень исполнения — проведение экспериментов в компьютерном режиме, обработку данных, проверку доказательств — чтобы освободить ученых для тех частей исследования, где человеческое суждение имеет наибольшее значение: определение вопросов, формирование гипотез, интерпретация результатов и сообщение результатов.

Проект также явно построен как движущаяся цель. Там, где многие тесты выпускаются один раз и отбрасываются (в объявлении это называется проблемой «документов для публикации»), Terminal-Bench-Science задуман как непрерывный тест, который развивается вдоль границы, с регулярными выпусками, предназначенными для того, чтобы оценка опережала прогресс модели и предотвращала инфляцию оценок, вызванную загрязнением.

Первая таблица лидеров: до надежности еще далеко

Таблица лидеров v0.1, которая привлекла значительное внимание, когда она появилась на Hacker News на этой неделе, показывает резкое падение с вершины:

  • Клод Опус 5 (Код Клода): 30,0%
  • Соль GPT-5.6 (Кодекс): 22,4%
  • Клод Басня 5 (Код Клода): 21,4%
  • Клод Опус 4.8 (Код Клода): 10,5%
  • GPT-5.6 Терра (Кодекс): 8,6%
  • GLM 5.3 (код Клода): 8,1%
  • Кими К3 (Клод Код): 7,1%
  • Грок 4.6 (сборка Грока): 7,1%
  • GPT-5.6 Луна (Кодекс): 3,3%

Результаты показывают, что научные рабочие процессы остаются для агентов существенно более сложными, чем разработка программного обеспечения, где результаты оригинального Terminal-Bench и конкурирующих тестов кодирования быстро растут. Уровень разрешения 30% для наилучшей доступной системы означает, что в семи из десяти реальных исследовательских задач даже агент высшего уровня в сочетании с надежным оборудованием не сможет выполнить проверяемо правильную работу.

Поучительно и распределение внутри модельных семейств. Разрыв между Claude Opus 5 и Claude Opus 4.8 (почти двадцать баллов) и между вариантами GPT-5.6 Sol, Terra и Luna показывает, насколько качество результата зависит от взаимодействия модели и агентов, а не только от сырого интеллекта модели. В каждой записи, набравшей высокие баллы, используется агентское кодирование (Claude Code, Codex, Grok Build), что укрепляет зарождающийся консенсус в отношении того, что строительные леса так же важны, как и лежащие в их основе веса.

Почему ученые создали свой собственный эталон

Формулировка показателя содержит тонкий институциональный аргумент. «Ставки в науке слишком высоки, — говорится в заявлении, — и ее ориентиры должны отражать приоритеты научного сообщества, а не внешние интересы». Проект предоставляет работающим исследователям прямой механизм для кодирования задач, которые им действительно нужны в автоматизации, и сопоставляет заявления поставщиков об «ускорении научных открытий» с проверяемым стандартом.

Это важно, потому что разрыв между маркетингом и реальностью имеет реальные последствия. Если пограничные лаборатории заявляют, что их агенты могут ускорить исследования, в то время как независимые экспертные оценки показывают процент разрешения от однозначных до 30%, то решения о финансировании, планы найма и политика лабораторий, основанная на этих утверждениях, наследуют ошибку. Непрерывные, принадлежащие сообществу контрольные показатели являются одним из корректирующих факторов: они преобразуют расплывчатые заявления в воспроизводимые цифры.

Сигнал для исследовательских институтов

Для университетов, национальных лабораторий и групп исследований и разработок, решающих, когда развертывать агенты, тест предлагает то, чего не могут предложить демонстрационные версии поставщиков: поддерживаемое сообществом измерение того, где на самом деле находится линия надежности. Коэффициент разрешения около 10–20 означает, что сегодня к этим системам лучше всего относиться как к помощникам, требующим проверки, а не как к автономным исполнителям экспериментальных конвейеров. Категории задач, охватывающие жизненные, физические, земные, математические и инженерные науки, также дают специалистам в предметной области шаблон для участия в рабочих процессах из областей, которые общие тесты обычно упускают из виду.

Более широкий контекст отрасли подтверждает, почему время имеет значение. Наука стала одним из наиболее широко рекламируемых вариантов использования передового искусственного интеллекта: лаборатории рекламируют вклад в открытие материалов, науку о белках и математику. Эти утверждения трудно проверить: результаты научных исследований подтверждаются медленно, а энтузиазм движется быстрее, чем тиражирование. Тест, который оценивает проверяемые артефакты в реальных рабочих процессах, дает исследовательским институтам возможность отделить продемонстрированные возможности от демонстрационного театра — и отслеживать, выпуск за выпуском, развивается ли агентный прогресс в науке так же быстро, как в разработке программного обеспечения, где Terminal-Bench впервые сделал свое имя.

Для индустрии искусственного интеллекта послание версии 0.1 носит обоюдоострый характер. Граница явно продвигается — 30% Opus 5 превосходят 10,5% более старого Opus 4.8 — но потолок по-прежнему далек от той надежности, которую требуют настоящие лаборатории. Разработчики теста говорят, что регулярные выпуски будут точно отслеживать, насколько быстро сокращается этот разрыв. У ученых, наблюдающих за новыми тенденциями в области искусственного интеллекта в инструментах агентных исследований, теперь есть критерий, который они построили сами.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →