Tolok ukur anyar nantang kepiye industri AI ngukur kemampuan ilmiah, lan asil sing sepisanan ngremehake laboratorium perbatasan. Terminal-Bench-Science 0.1, diluncurake minggu iki dening peneliti ing Universitas Stanford lan tim ing mburi pathokan coding Terminal-Bench sing populer, ngevaluasi agen AI babagan alur kerja riset ilmiah nyata sing disumbang dening para ilmuwan sing kerja - lan model paling kuat sing diuji, Claude Opus 5 sing mlaku liwat Claude Code, mung ngrampungake 30% tugas.
Kaca woro-woro pathokan kasebut kanthi terang-terangan nerangake prinsip pandhuane: para ilmuwan, dudu pangembang model utawa vendor data, kudu nyetel bar kanggo kemampuan ilmiah ing AI. Proyèk iki dibangun kanthi kolaborasi karo ahli domain saka institusi riset ing saindhenging donya, lan rilis pisanan kalebu 70 tugas sing nyakup èlmu urip, fisika, ilmu bumi, matématika, lan teknik.
Bedane karo Tolok ukur Buku Teks
Umume evaluasi AI ilmiah nguji kawruh: pitakonan pilihan ganda, masalah buku teks, latihan standar. Terminal-Bench-Science tinimbang ngukur apa agen bisa nglakokaké alur kerja sing nuntut sacara teknis, wektu sing ngisi dina-dina peneliti nyata - jenis karya sing ora katon ing ujian. Tugas mlaku ing lingkungan sing nyata, lan gradasi adhedhasar artefak konkrit: analisis, simulasi, bukti, kode, lan produk data, dicenthang nganggo tes khusus tugas sing bisa direproduksi tinimbang model hakim utawa skor pilihan ganda.
Desain kasebut nggambarake teori babagan apa sing kudu ditindakake asisten AI kanggo ilmu pengetahuan. Tinimbang ngganti pangadilan ilmiah, penulis pathokan mbantah, agen kudu njupuk alih lapisan eksekusi - nglakokake eksperimen-in-silico, ngolah data, mriksa bukti - kanggo mbebasake ilmuwan kanggo bagean riset ing ngendi pangadilan manungsa paling penting: nemtokake pitakonan, mbentuk hipotesis, interpretasi asil, lan temuan komunikasi.
Proyek kasebut uga dibangun kanthi jelas minangka target sing obah. Ing ngendi akeh benchmarks dirilis sapisan lan ditinggalake - woro-woro kasebut minangka masalah "makalah kanggo nerbitake" - Terminal-Bench-Science dirancang minangka pathokan terus-terusan sing berkembang bebarengan karo wates, kanthi rilis biasa sing dimaksudake kanggo njaga evaluasi sadurunge kemajuan model lan nyegah inflasi skor sing didorong kontaminasi.
Papan Pimpinan Pisanan: Adoh saka Dipercaya
Papan pimpinan v0.1, sing narik kawigaten nalika tekan Hacker News minggu iki, nuduhake drop-off sing curam saka ndhuwur:
- Claude Opus 5 (Kode Claude): 30,0%
- GPT-5.6 Sol (Kodeks): 22.4%
- Claude Fable 5 (Kode Claude): 21,4%
- Claude Opus 4.8 (Kode Claude): 10,5%
- GPT-5.6 Terra (Kodeks): 8.6%
- GLM 5.3 (Kode Claude): 8.1%
- Kimi K3 (Kode Claude): 7,1%
- Grok 4.6 (Grok Mbangun): 7.1%
- GPT-5.6 Luna (Kodeks): 3.3%
Asil kasebut nuduhake alur kerja ilmiah tetep luwih angel kanggo agen tinimbang rekayasa piranti lunak, ing endi tolok ukur koding Terminal-Bench lan saingan wis ndeleng skor mundhak kanthi cepet. Tingkat résolusi 30% kanggo sistem paling apik sing kasedhiya tegese ing pitung sepuluh tugas riset nyata, malah agen tingkat paling dhuwur sing dipasangake karo sabuk sing kuwat gagal ngasilake karya sing bener.
Panyebaran ing kulawarga model uga instruktif. Longkangan antarane Claude Opus 5 lan Claude Opus 4.8 - saklawasé rong puluh TCTerms - lan antarane GPT-5.6 varian Sol, Terra, lan Luna nuduhake pinten kualitas asil gumantung ing interplay saka model lan agen sabuk, ora mentahan Intelligence model piyambak. Saben entri skor dhuwur nggunakake sabuk kode agen (Claude Code, Codex, Grok Build), nguatake konsensus sing muncul yen scaffolding minangka nemtokake minangka bobot dhasar.
Napa Ilmuwan Nggawe Benchmark Dhewe
Framing pathokan kasebut ngemot argumentasi institusional sing subtle. "Tokoh ing ilmu pengetahuan dhuwur banget," ujare woro-woro kasebut, "lan pathokan kasebut kudu nggambarake prioritas komunitas ilmiah tinimbang kepentingan njaba." Proyèk kasebut menehi peneliti sing kerja mekanisme langsung kanggo ngodhe tugas sing bener-bener perlu otomatis - lan kanggo nahan klaim vendor babagan "nyepetake panemuan ilmiah" nglawan standar sing bisa diverifikasi.
Sing penting amarga kesenjangan antarane marketing lan kasunyatan duweni akibat nyata. Yen laboratorium perbatasan ngaku agen kasebut bisa nyepetake riset nalika evaluasi mandiri, sing dirancang pakar nuduhake tingkat resolusi siji-digit nganti 30%, keputusan pendanaan, rencana nyewa, lan kabijakan lab sing dibangun ing klaim kasebut minangka warisan kesalahan kasebut. Tolok ukur sing terus-terusan, sing diduweni komunitas minangka salah sawijining koreksi: ngonversi klaim sing ora jelas dadi angka sing bisa direproduksi.
Sinyal kanggo Lembaga Riset
Kanggo universitas, laboratorium nasional, lan tim R&D sing nimbang nalika ngirim agen, pathokan kasebut nawakake demo vendor sing ora bisa ditindakake: pangukuran sing dikelola komunitas ing endi garis linuwih. Tingkat resolusi ing umur remaja utawa rong puluhan tegese sistem iki dianggep paling apik saiki minangka asisten sing mbutuhake ditinjau, dudu minangka pelaksana otonomi pipa eksperimen. Kategori tugas - sing nyakup ilmu urip, fisik, Bumi, matématika, lan teknik - uga menehi spesialis domain minangka cithakan kanggo nyumbang alur kerja saka lapangan sing biasa diabaikan pathokan umum.
Konteks industri sing luwih amba nguatake sebabe wektu kasebut penting. Ilmu wis dadi salah sawijining kasus panggunaan sing paling akeh dipromosikan kanggo AI perbatasan, kanthi laboratorium menehi sumbangan kanggo panemuan materi, ilmu protein, lan matematika. Klaim kasebut angel diaudit: output ilmiah alon divalidasi, lan semangat luwih cepet tinimbang replikasi. Tolok ukur sing menehi nilai artefak sing bisa diverifikasi ing alur kerja nyata menehi institusi riset cara kanggo misahake kemampuan sing dituduhake saka teater demonstrasi - lan kanggo nglacak, diluncurake kanthi rilis, manawa kemajuan agen ing ilmu pengetahuan saya tambah cepet kaya ing teknik piranti lunak, ing ngendi Terminal-Bench pisanan digawe jenenge.
Kanggo industri AI, pesen v0.1 loro-edged. Perbatasan kasebut kanthi jelas maju - menara 30% Opus 5 ngluwihi 10.5% Opus 4.8 sing lawas - nanging langit-langit tetep adoh saka sing dibutuhake laboratorium nyata. Desainer pathokan ujar manawa rilis reguler bakal nglacak sepira cepet celah kasebut ditutup. Para ilmuwan sing nonton tren AI sing berkembang ing alat riset agen saiki duwe ukuran sing digawe dhewe.
---
Tetep Ahead of AIEntuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.
Waca liyane AI warta →