Penanda aras baharu mencabar cara industri AI mengukur keupayaan saintifik, dan keputusan pertamanya adalah merendah diri untuk makmal sempadan. Terminal-Bench-Science 0.1, yang dilancarkan minggu ini oleh penyelidik di Universiti Stanford dan pasukan di sebalik penanda aras pengekodan Terminal-Bench yang popular, menilai ejen AI mengenai aliran kerja penyelidikan saintifik sebenar yang disumbangkan oleh saintis yang bekerja — dan model terkuat yang diuji, Claude Opus 5 yang dijalankan melalui Claude Code, menyelesaikan hanya 30% daripada tugasan.
Halaman pengumuman penanda aras menerangkan prinsip panduannya secara terang-terangan: saintis, bukan pembangun model atau vendor data, harus menetapkan bar untuk keupayaan saintifik dalam AI. Projek ini dibina dengan kerjasama pakar domain daripada institusi penyelidikan di seluruh dunia, dan keluaran pertamanya termasuk 70 tugasan merangkumi sains hayat, fizik, sains Bumi, matematik dan kejuruteraan.
Bagaimana Ia Berbeza Daripada Penanda Aras Buku Teks
Kebanyakan penilaian AI saintifik menguji pengetahuan: soalan aneka pilihan, masalah buku teks, latihan piawai. Terminal-Bench-Science sebaliknya mengukur sama ada ejen boleh melaksanakan aliran kerja yang menuntut secara teknikal dan memakan masa yang mengisi hari penyelidik sebenar — jenis kerja yang muncul tanpa peperiksaan. Tugasan dijalankan dalam persekitaran yang realistik dan penggredan adalah berdasarkan artifak konkrit: analisis, simulasi, pembuktian, kod dan produk data, disemak dengan ujian khusus tugasan yang boleh dihasilkan dan bukannya model hakim atau pemarkahan aneka pilihan.
Reka bentuk itu mencerminkan teori tentang perkara yang akhirnya harus dilakukan oleh pembantu AI untuk sains. Daripada menggantikan pertimbangan saintifik, pengarang penanda aras berpendapat, ejen harus mengambil alih lapisan pelaksanaan — menjalankan eksperimen dalam siliko, memproses data, menyemak bukti — untuk membebaskan saintis bagi bahagian penyelidikan yang paling penting pertimbangan manusia: mentakrifkan soalan, membentuk hipotesis, mentafsir keputusan dan menyampaikan penemuan.
Projek ini juga dibina secara eksplisit sebagai sasaran bergerak. Apabila banyak penanda aras dikeluarkan sekali dan ditinggalkan — pengumuman itu menyebut ini sebagai masalah "kertas kerja untuk diterbitkan" — Terminal-Bench-Science direka sebagai penanda aras berterusan yang berkembang bersama sempadan, dengan keluaran tetap bertujuan untuk memastikan penilaian mendahului kemajuan model dan mencegah inflasi skor yang didorong oleh pencemaran.
Papan Pendahulu Pertama: Jauh Daripada Boleh Dipercayai
Papan pendahulu v0.1, yang menarik perhatian penting apabila ia mencapai Berita Penggodam minggu ini, menunjukkan penurunan mendadak dari atas:
- Claude Opus 5 (Kod Claude): 30.0%
- GPT-5.6 Sol (Codex): 22.4%
- Claude Fable 5 (Claude Code): 21.4%
- Claude Opus 4.8 (Kod Claude): 10.5%
- GPT-5.6 Terra (Codex): 8.6%
- GLM 5.3 (Kod Claude): 8.1%
- Kimi K3 (Kod Claude): 7.1%
- Grok 4.6 (Grok Build): 7.1%
- GPT-5.6 Luna (Codex): 3.3%
Hasilnya mencadangkan aliran kerja saintifik kekal lebih sukar untuk ejen berbanding kejuruteraan perisian, di mana Terminal-Bench asal dan penanda aras pengekodan saingan telah menyaksikan markah meningkat dengan pantas. Kadar resolusi 30% untuk sistem terbaik yang tersedia bermakna bahawa pada tujuh daripada sepuluh tugas penyelidikan sebenar, ejen peringkat atasan yang dipasangkan dengan abah-abah yang kuat gagal menghasilkan kerja yang betul yang boleh disahkan.
Penyebaran dalam keluarga model juga memberi pengajaran. Jurang antara Claude Opus 5 dan Claude Opus 4.8 — hampir dua puluh mata — dan antara varian GPT-5.6 Sol, Terra dan Luna menunjukkan berapa banyak kualiti hasil bergantung pada interaksi model dan abah-abah ejen, bukan risikan model mentah sahaja. Setiap kemasukan berskor tinggi menggunakan abah-abah pengekodan agen (Claude Code, Codex, Grok Build), mengukuhkan konsensus yang timbul bahawa perancah adalah sama pentingnya dengan pemberat asas.
Mengapa Saintis Membina Penanda Aras Mereka Sendiri
Pembingkaian penanda aras membawa hujah institusi yang halus. "Kepentingan dalam sains terlalu tinggi," kata pengumuman itu, "dan penanda arasnya mesti mencerminkan keutamaan komuniti saintifik dan bukannya kepentingan luar." Projek ini memberi penyelidik yang bekerja mekanisme langsung untuk mengekod tugas yang sebenarnya mereka perlukan secara automatik — dan untuk menahan dakwaan vendor tentang "mempercepatkan penemuan saintifik" terhadap standard yang boleh disahkan.
Itu penting kerana jurang antara pemasaran dan realiti mempunyai akibat yang nyata. Jika makmal sempadan mendakwa ejen mereka boleh mempercepatkan penyelidikan manakala penilaian bebas yang direka pakar menunjukkan kadar resolusi satu digit hingga 30%, keputusan pembiayaan, rancangan pengambilan pekerja dan dasar makmal yang dibina berdasarkan tuntutan tersebut mewarisi ralat. Penanda aras milik komuniti yang berterusan adalah satu pembetulan: ia menukar tuntutan yang tidak jelas kepada nombor yang boleh diterbitkan semula.
Isyarat untuk Institusi Penyelidikan
Untuk universiti, makmal kebangsaan dan pasukan R&D yang menimbang masa untuk menggunakan ejen, penanda aras menawarkan sesuatu yang tidak boleh dilakukan oleh tunjuk cara vendor: ukuran yang diselenggara oleh komuniti tentang kedudukan garis kebolehpercayaan sebenarnya. Kadar resolusi pada usia remaja atau dua puluhan bermakna sistem ini dianggap paling baik hari ini sebagai pembantu yang memerlukan semakan, bukan sebagai pelaksana autonomi saluran paip eksperimen. Kategori tugasan — merangkumi sains hayat, fizikal, Bumi, matematik dan kejuruteraan — juga memberi pakar domain templat untuk menyumbang aliran kerja daripada bidang yang sering diabaikan oleh penanda aras generik.
Konteks industri yang lebih luas mengukuhkan sebab masa itu penting. Sains telah menjadi salah satu kes penggunaan yang paling digalakkan untuk AI sempadan, dengan makmal menggembar-gemburkan sumbangan kepada penemuan bahan, sains protein dan matematik. Tuntutan tersebut sukar untuk diaudit: output saintifik lambat untuk disahkan, dan semangat bergerak lebih pantas daripada replikasi. Penanda aras yang menggredkan artifak yang boleh disahkan pada aliran kerja sebenar memberikan institusi penyelidikan cara untuk memisahkan keupayaan yang ditunjukkan daripada teater demonstrasi — dan untuk menjejaki, keluaran melalui keluaran, sama ada kemajuan agen dalam sains bertambah secepat ia dalam kejuruteraan perisian, tempat Terminal-Bench mula mencipta namanya.
Untuk industri AI, mesej v0.1 adalah bermuka dua. Sempadan jelas semakin maju — menara 30% Opus 5 mengatasi 10.5% Opus 4.8 yang lebih lama — tetapi silingnya masih jauh daripada keperluan makmal sebenar yang boleh dipercayai. Pereka bentuk penanda aras berkata keluaran biasa akan menjejaki dengan tepat berapa cepat jurang itu ditutup. Para saintis yang menonton trend AI yang muncul dalam alat penyelidikan agen kini mempunyai kayu ukur yang mereka bina sendiri.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →