Nový benchmark je výzvou pro to, jak průmysl AI měří vědecké schopnosti, a jeho první výsledky jsou pro hraniční laboratoře ponižující. Terminal-Bench-Science 0.1, který tento týden spustili výzkumníci ze Stanfordské univerzity a tým stojící za populárním kódovacím benchmarkem Terminal-Bench, hodnotí agenty AI na skutečných vědeckých výzkumných pracovních postupech, na kterých přispěli pracující vědci – a nejsilnější testovaný model, Claude Opus 5 procházející přes Claude Code, dokončil pouze 30 % úkolů.
Stránka s oznámením benchmarku přímo popisuje jeho hlavní princip: vědci, nikoli vývojáři modelů nebo prodejci dat, by měli nastavit laťku pro vědecké schopnosti v AI. Projekt byl vytvořen ve spolupráci s doménovými experty z výzkumných institucí po celém světě a jeho první verze obsahuje 70 úkolů zahrnujících vědy o živé přírodě, fyziku, vědu o Zemi, matematiku a inženýrství.
Jak se liší od benchmarků v učebnici
Většina vědeckých hodnocení umělé inteligence testuje znalosti: otázky s výběrem odpovědí, učebnicové problémy, standardizovaná cvičení. Terminal-Bench-Science místo toho měří, zda agenti dokážou provádět technicky náročné a časově náročné pracovní postupy, které zaplňují dny skutečných výzkumníků – druh práce, který se neobjevuje v žádné zkoušce. Úkoly běží v realistickém prostředí a hodnocení je založeno na konkrétních artefaktech: analýzách, simulacích, nátiskech, kódu a datových produktech, kontrolovaných reprodukovatelnými testy specifických pro daný úkol, spíše než posuzovacími modely nebo bodováním s více možnostmi.
Tento design odráží teorii toho, co by asistenti umělé inteligence nakonec měli dělat pro vědu. Spíše než nahrazování vědeckého úsudku, tvrdí autoři benchmarku, by agenti měli převzít prováděcí vrstvu – provozovat experimenty in-silico, zpracovávat data, kontrolovat důkazy – aby uvolnili vědce pro ty části výzkumu, kde je lidský úsudek nejdůležitější: definování otázek, vytváření hypotéz, interpretace výsledků a sdělování zjištění.
Projekt je také výslovně postaven jako pohyblivý cíl. Tam, kde je mnoho benchmarků zveřejněno jednou a opuštěno – oznámení tomu říká problém „papers to publish“ – Terminal-Bench-Science je navržen jako nepřetržitý benchmark, který se vyvíjí podél hranice, s pravidelným vydáváním, jehož cílem je udržet hodnocení před pokrokem modelu a zabránit inflaci skóre způsobené kontaminací.
První žebříček: Dlouhá cesta ke spolehlivosti
Žebříček v0.1, který přitáhl značnou pozornost, když tento týden dosáhl Hacker News, ukazuje strmý pokles shora:
- Claude Opus 5 (Claude Code): 30,0 %
- GPT-5.6 Sol (Codex): 22,4 %
- Claude Fable 5 (Claude Code): 21,4 %
- Claude Opus 4.8 (Claude Code): 10,5 %
- GPT-5.6 Terra (Codex): 8,6 %
- GLM 5.3 (Claude Code): 8,1 %
- Kimi K3 (Claude Code): 7,1 %
- Grok 4.6 (Grok Build): 7,1 %
Výsledky naznačují, že vědecké pracovní postupy zůstávají pro agenty podstatně obtížnější než softwarové inženýrství, kde původní Terminal-Bench a konkurenční kódovací benchmarky zaznamenaly rychlý nárůst skóre. 30% míra rozlišení u nejlepšího dostupného systému znamená, že u sedmi z deseti skutečných výzkumných úkolů ani agent nejvyšší úrovně spárovaný se silným svazkem nedokáže prokázat prokazatelně správnou práci.
Poučné je také rozšíření v rámci modelových rodin. Rozdíl mezi Claude Opus 5 a Claude Opus 4.8 – téměř dvacet bodů – a mezi variantami GPT-5.6 Sol, Terra a Luna ukazuje, jak moc závisí kvalita výsledku na souhře modelu a využití agentů, nikoli na samotné hrubé modelové inteligenci. Každá položka s vysokým skóre používá svazek agentního kódování (Claude Code, Codex, Grok Build), což posiluje vznikající konsenzus, že lešení je stejně rozhodující jako základní váhy.
Proč si vědci sestavili svůj vlastní benchmark
Rámování benchmarku nese jemný institucionální argument. "V sázce na vědu je příliš mnoho," uvádí se v oznámení, "a její měřítka musí odrážet priority vědecké komunity spíše než vnější zájmy." Projekt dává pracujícím výzkumníkům přímý mechanismus, jak zakódovat úkoly, které skutečně potřebují, automatizovaně – a postavit tvrzení prodejců o „urychlení vědeckého objevu“ proti ověřitelnému standardu.
To je důležité, protože propast mezi marketingem a realitou má skutečné důsledky. Pokud hraniční laboratoře tvrdí, že jejich agenti mohou urychlit výzkum, zatímco nezávislá, expertně navržená hodnocení ukazují jednociferné až 30% míry řešení, rozhodnutí o financování, plány náboru a laboratorní zásady postavené na těchto tvrzeních zdědí chybu. Průběžné, komunitou vlastněné benchmarky jsou jedním z nápravných opatření: převádějí vágní tvrzení na reprodukovatelná čísla.
Signál pro výzkumné instituce
Pro univerzity, národní laboratoře a výzkumné a vývojové týmy, které zvažují, kdy nasadit agenty, benchmark nabízí něco, co ukázky dodavatelů nemohou: komunitou spravované měření toho, kde se skutečně nachází linie spolehlivosti. Míra rozlišení mezi náctiletými nebo dvacátými lety znamená, že s těmito systémy se dnes nejlépe zachází jako s asistenty, kteří vyžadují kontrolu, nikoli jako s autonomními vykonavateli experimentálních potrubí. Kategorie úkolů – zahrnující život, fyzikální vědy, Zemi, matematické a technické vědy – také poskytují doménovým specialistům šablonu pro přispívání pracovních postupů z oblastí, které generické benchmarky běžně přehlížejí.
Širší kontext odvětví posiluje, proč na načasování záleží. Věda se stala jedním z nejvíce propagovaných případů použití hraniční umělé inteligence, přičemž laboratoře propagují příspěvky k objevování materiálů, proteinové vědě a matematice. Tato tvrzení se obtížně kontrolují: vědecký výstup se ověřuje pomalu a nadšení je rychlejší než replikace. Benchmark, který hodnotí ověřitelné artefakty na skutečných pracovních postupech, dává výzkumným institucím způsob, jak oddělit prokázané schopnosti od demonstračního divadla – a sledovat, vydávání za vydáním, zda se pokrok agentů ve vědě spojuje stejně rychle jako v softwarovém inženýrství, kde si Terminal-Bench poprvé udělal jméno.
Pro průmysl AI je poselství v0.1 dvojsečné. Hranice se jasně posouvá – 30 % Opus 5 převyšuje 10,5 % staršího Opusu 4.8 – ale strop zůstává daleko od spolehlivosti, kterou skutečné laboratoře vyžadují. Návrháři benchmarku říkají, že pravidelná vydání budou přesně sledovat, jak rychle se tato mezera uzavírá. Vědci sledující vznikající trendy umělé inteligence v nástrojích pro výzkum agentů nyní mají měřítko, které si sami vytvořili.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →