Новий тест ставить під сумнів те, як індустрія штучного інтелекту вимірює наукові можливості, і його перші результати принизливі для передових лабораторій. Terminal-Bench-Science 0.1, запущений цього тижня дослідниками зі Стенфордського університету та командою, яка розробила популярний тест кодування Terminal-Bench, оцінює агентів штучного інтелекту на реальних науково-дослідницьких робочих процесах, внесених працюючими вченими — і найпотужніша перевірена модель, Claude Opus 5, що працює через Claude Code, виконала лише 30% завдань.
Сторінка анонсу бенчмарку прямо описує його керівний принцип: вчені, а не розробники моделей чи постачальники даних, повинні встановлювати планку наукових можливостей ШІ. Проект створено у співпраці з експертами з дослідницьких установ з усього світу, і його перший випуск включає 70 завдань, що охоплюють науки про життя, фізику, науки про Землю, математику та інженерію.
Чим він відрізняється від тестів підручника
Більшість наукових оцінок штучного інтелекту перевіряють знання: запитання з варіантами відповідей, завдання підручників, стандартизовані вправи. Натомість Terminal-Bench-Science визначає, чи можуть агенти виконувати технічно складні та трудомісткі робочі процеси, які заповнюють робочі дні справжніх дослідників, — така робота, яка не з’являється на жодному іспиті. Завдання виконуються в реалістичному середовищі, а оцінювання базується на конкретних артефактах: аналізах, симуляціях, доказах, коді та продуктах даних, перевірених відтворюваними тестами для конкретних завдань, а не на моделях суддів чи оцінці з кількома варіантами відповіді.
Цей дизайн відображає теорію про те, що помічники штучного інтелекту в кінцевому підсумку повинні зробити для науки. Замість заміни наукового судження, стверджують автори тесту, агенти повинні взяти на себе рівень виконання — проведення експериментів in-silico, обробку даних, перевірку доказів — щоб звільнити вчених для тих частин дослідження, де людське судження має найбільше значення: визначення питань, формування гіпотез, інтерпретація результатів і передача результатів.
Проект також явно побудований як рухома ціль. Там, де багато тестів випускаються один раз і відмовляються — в оголошенні це називається проблемою «документів для публікації» — Terminal-Bench-Science розроблено як безперервний тест, який розвивається поряд із межею, з регулярними випусками, призначеними для того, щоб оцінка випереджала прогрес моделі та запобігала інфляції результатів, спричиненій забрудненням.
Перша таблиця лідерів: довгий шлях від надійності
Таблиця лідерів версії 0.1, яка привернула значну увагу, коли цього тижня потрапила до Hacker News, демонструє різке падіння з вершини:
- Claude Opus 5 (Claude Code): 30,0%
- GPT-5.6 Sol (Кодекс): 22,4%
- Claude Fable 5 (Claude Code): 21,4%
- Claude Opus 4.8 (Claude Code): 10,5%
- GPT-5.6 Terra (Codex): 8,6%
- GLM 5.3 (Claude Code): 8,1%
- Kimi K3 (Claude Code): 7,1%
- Grok 4.6 (Grok Build): 7,1%
- GPT-5.6 Luna (Codex): 3,3%
Результати свідчать про те, що наукові робочі процеси залишаються значно складнішими для агентів, ніж розробка програмного забезпечення, де оригінальний термінальний стенд і конкурентні тести кодування показали стрімке зростання показників. Коефіцієнт вирішення 30% для найкращої доступної системи означає, що для семи з десяти справжніх дослідницьких завдань навіть агент найвищого рівня в поєднанні з потужною системою не зможе виконати перевірено правильну роботу.
Повчальним є також поширення в модельних сім'ях. Розрив між Claude Opus 5 і Claude Opus 4.8 — майже двадцять балів — і між варіантами GPT-5.6 Sol, Terra та Luna показує, наскільки якість результату залежить від взаємодії моделі та агента, а не лише від необробленого інтелекту моделі. У кожному записі з високими балами використовується агентське кодування (Claude Code, Codex, Grok Build), що зміцнює консенсус, що формується консенсус щодо того, що каркас є таким же вирішальним, як і базові ваги.
Чому вчені створили власний тест
Обрамлення бенчмарка містить тонкий інституційний аргумент. «Ставки в науці занадто високі, — йдеться в повідомленні, — і її показники мають відображати пріоритети наукової спільноти, а не зовнішні інтереси». Проект дає працюючим дослідникам прямий механізм для кодування завдань, які вони дійсно потребують автоматизації — і порівнювати заяви постачальників щодо «прискорення наукових відкриттів» зі стандартом, який можна перевірити.
Це важливо, тому що розрив між маркетингом і реальністю має реальні наслідки. Якщо передові лабораторії стверджують, що їхні агенти можуть пришвидшити дослідження, тоді як незалежні, розроблені експертами оцінки показують відсоток вирішення від однієї цифри до 30%, рішення про фінансування, плани найму та політика лабораторії, побудована на цих твердженнях, успадковують помилку. Безперервні еталонні показники, що належать громаді, є одним із способів виправлення: вони перетворюють нечіткі твердження у відтворювані числа.
Сигнал для науково-дослідних установ
Для університетів, національних лабораторій і дослідницьких груп, які зважують, коли розгортати агенти, тестування пропонує те, чого не можуть продемонструвати постачальники: вимірювання, яке підтримується спільнотою, де насправді знаходиться межа надійності. Рівень вирішення проблеми у підлітковому чи двадцятирічному віці означає, що сьогодні краще розглядати ці системи як помічників, які потребують перегляду, а не як автономних виконавців експериментальних конвеєрів. Категорії завдань — що охоплюють життя, фізичні науки, науку про Землю, математику та інженерні науки — також дають фахівцям із домену шаблон для створення робочих процесів із галузей, які стандартні контрольні тести зазвичай пропускають.
Більш широкий галузевий контекст підсилює важливість часу. Наука стала одним із найбільш рекламованих випадків використання передового ШІ, а лабораторії рекламують свій внесок у відкриття матеріалів, науку про білки та математику. Ці твердження важко перевірити: наукові результати повільно перевіряються, а ентузіазм розвивається швидше, ніж тиражування. Еталонний тест, який оцінює верифіковані артефакти на реальних робочих процесах, дає дослідницьким установам спосіб відокремити продемонстровані можливості від демонстраційного театру — і відстежувати, реліз за релізом, чи прогрес агентів у науці зростає так само швидко, як у розробці програмного забезпечення, де Terminal-Bench вперше отримав свою назву.
Для індустрії штучного інтелекту повідомлення версії 0.1 є двосічним. Межа явно просувається — 30% Opus 5 перевищують 10,5% у старішого Opus 4.8 — але стеля залишається далекою від надійності, якої вимагають справжні лабораторії. Розробники еталонного тесту кажуть, що регулярні випуски точно відстежуватимуть, наскільки швидко заповнюється цей розрив. Вчені, які спостерігають за [новими тенденціями штучного інтелекту] (https://aibuzzwire.news) в інструментах агентних досліджень, тепер мають мірило, яке вони створили самі.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →