Một chuẩn mực mới đang thách thức cách ngành công nghiệp AI đo lường năng lực khoa học và những kết quả đầu tiên của nó đang khiến các phòng thí nghiệm ở tuyến đầu phải khiêm tốn. Terminal-Bench-Science 0.1, được ra mắt trong tuần này bởi các nhà nghiên cứu tại Đại học Stanford và nhóm đằng sau tiêu chuẩn mã hóa Terminal-Bench phổ biến, đánh giá các tác nhân AI trên quy trình nghiên cứu khoa học thực tế do các nhà khoa học đang làm việc đóng góp — và mô hình mạnh nhất đã được thử nghiệm, Claude Opus 5 chạy qua Mã Claude, chỉ hoàn thành 30% nhiệm vụ.

Trang thông báo của điểm chuẩn mô tả nguyên tắc hướng dẫn của nó một cách thẳng thắn: các nhà khoa học, không phải nhà phát triển mô hình hoặc nhà cung cấp dữ liệu, nên đặt ra tiêu chuẩn cho năng lực khoa học trong AI. Dự án được xây dựng với sự cộng tác của các chuyên gia lĩnh vực từ các tổ chức nghiên cứu trên khắp thế giới và bản phát hành đầu tiên của nó bao gồm 70 nhiệm vụ trải rộng trên các lĩnh vực khoa học đời sống, vật lý, khoa học Trái đất, toán học và kỹ thuật.

Nó khác với điểm chuẩn của sách giáo khoa như thế nào

Hầu hết các bài đánh giá AI khoa học đều kiểm tra kiến thức: câu hỏi trắc nghiệm, bài tập sách giáo khoa, bài tập chuẩn hóa. Thay vào đó, Terminal-Bench-Science đo lường xem liệu các đại lý có thể thực hiện các quy trình công việc đòi hỏi khắt khe về mặt kỹ thuật, tốn thời gian để lấp đầy thời gian làm việc thực tế của các nhà nghiên cứu hay không — loại công việc không xuất hiện trong kỳ thi. Nhiệm vụ chạy trong môi trường thực tế và việc chấm điểm dựa trên các thành phần cụ thể: phân tích, mô phỏng, bằng chứng, mã và sản phẩm dữ liệu, được kiểm tra bằng các bài kiểm tra dành riêng cho nhiệm vụ có thể tái tạo thay vì đánh giá mô hình hoặc chấm điểm trắc nghiệm.

Thiết kế đó phản ánh lý thuyết về những gì trợ lý AI cuối cùng sẽ làm cho khoa học. Các tác giả của tiêu chuẩn lập luận rằng thay vì thay thế phán đoán khoa học, các tác nhân nên đảm nhận lớp thực thi - chạy thí nghiệm trong silico, xử lý dữ liệu, kiểm tra bằng chứng - để giải phóng các nhà khoa học cho các phần nghiên cứu mà phán đoán của con người quan trọng nhất: xác định câu hỏi, hình thành giả thuyết, diễn giải kết quả và truyền đạt kết quả.

Dự án cũng được xây dựng rõ ràng như một mục tiêu di động. Trong trường hợp nhiều điểm chuẩn được phát hành một lần và bị bỏ rơi — thông báo gọi đây là vấn đề "giấy tờ để xuất bản" - Terminal-Bench-Science được thiết kế như một điểm chuẩn liên tục phát triển dọc theo ranh giới, với các bản phát hành thường xuyên nhằm mục đích duy trì việc đánh giá trước tiến trình của mô hình và ngăn ngừa lạm phát điểm số do ô nhiễm.

Bảng xếp hạng đầu tiên: Còn một chặng đường dài mới đáng tin cậy

Bảng xếp hạng v0.1, đã thu hút sự chú ý đáng kể khi đến với Hacker News trong tuần này, cho thấy sự sụt giảm mạnh từ đầu:

  • Claude Opus 5 (Mã Claude): 30,0%
  • GPT-5.6 Sol (Codex): 22,4%
  • Truyện ngụ ngôn Claude 5 (Mã Claude): 21,4%
  • Claude Opus 4.8 (Mã Claude): 10,5%
  • GPT-5.6 Terra (Codex): 8,6%
  • GLM 5.3 (Mã Claude): 8,1%
  • Kimi K3 (Mã Claude): 7,1%
  • Grok 4.6 (Bản dựng Grok): 7,1%
  • GPT-5.6 Luna (Codex): 3,3%

Kết quả cho thấy quy trình làm việc khoa học vẫn khó khăn hơn đáng kể đối với các đại lý so với công nghệ phần mềm, nơi mà các điểm chuẩn mã hóa của Terminal-Bench và đối thủ ban đầu đã chứng kiến điểm số tăng lên nhanh chóng. Tỷ lệ phân giải 30% cho hệ thống tốt nhất hiện có có nghĩa là đối với bảy trong số mười nhiệm vụ nghiên cứu thực tế, ngay cả một tác nhân cấp cao nhất được kết hợp với dây nịt chắc chắn cũng không thể tạo ra kết quả chính xác có thể kiểm chứng được.

Sự lan rộng trong các gia đình kiểu mẫu cũng mang tính hướng dẫn. Khoảng cách giữa Claude Opus 5 và Claude Opus 4.8 — gần 20 điểm — và giữa các biến thể GPT-5.6 Sol, Terra và Luna cho thấy chất lượng kết quả phụ thuộc đến mức nào vào sự tương tác giữa mô hình và khai thác tác nhân, chứ không chỉ riêng trí thông minh của mô hình thô. Mọi mục có điểm cao đều sử dụng khai thác mã hóa tác nhân (Claude Code, Codex, Grok Build), củng cố sự đồng thuận đang nổi lên rằng việc dàn dựng cũng có tính quyết định như trọng lượng cơ bản.

Tại sao các nhà khoa học xây dựng điểm chuẩn riêng của họ

Việc xây dựng chuẩn mực mang một lập luận thể chế tinh tế. Thông báo nêu rõ: “Quyền lợi trong khoa học quá cao và các tiêu chuẩn của nó phải phản ánh các ưu tiên của cộng đồng khoa học hơn là lợi ích bên ngoài”. Dự án cung cấp cho các nhà nghiên cứu đang làm việc một cơ chế trực tiếp để mã hóa các nhiệm vụ mà họ thực sự cần tự động hóa - và giữ vững tuyên bố của các nhà cung cấp về việc "tăng tốc khám phá khoa học" theo tiêu chuẩn có thể kiểm chứng được.

Điều đó quan trọng vì khoảng cách giữa tiếp thị và thực tế có những hậu quả thực sự. Nếu các phòng thí nghiệm biên giới tuyên bố rằng đại lý của họ có thể tăng tốc nghiên cứu trong khi các đánh giá độc lập, do chuyên gia thiết kế cho thấy tỷ lệ giải quyết từ một chữ số đến 30% thì quyết định tài trợ, kế hoạch tuyển dụng và chính sách phòng thí nghiệm được xây dựng dựa trên những tuyên bố đó sẽ thừa hưởng lỗi. Các tiêu chuẩn liên tục, do cộng đồng sở hữu là một cách khắc phục: chúng chuyển những tuyên bố mơ hồ thành những con số có thể lặp lại.

Tín hiệu cho các cơ quan nghiên cứu

Đối với các trường đại học, phòng thí nghiệm quốc gia và nhóm R&D đang cân nhắc thời điểm triển khai các đại lý, điểm chuẩn này cung cấp một thứ mà bản demo của nhà cung cấp không thể: một phép đo do cộng đồng duy trì về vị trí thực sự của đường mức độ tin cậy. Tỷ lệ phân giải ở độ tuổi thanh thiếu niên hoặc tuổi đôi mươi có nghĩa là các hệ thống này ngày nay được coi là tốt nhất với tư cách là trợ lý cần được xem xét, chứ không phải là người thực thi tự chủ các quy trình thử nghiệm. Các danh mục nhiệm vụ - bao gồm khoa học đời sống, vật lý, Trái đất, toán học và kỹ thuật - cũng cung cấp cho các chuyên gia trong lĩnh vực một mẫu để đóng góp quy trình công việc từ các lĩnh vực mà điểm chuẩn chung thường bỏ qua.

Bối cảnh ngành rộng hơn củng cố lý do tại sao thời điểm lại quan trọng. Khoa học đã trở thành một trong những trường hợp sử dụng được quảng bá rầm rộ nhất cho AI tiên phong, với các phòng thí nghiệm khuyến khích những đóng góp trong khám phá vật liệu, khoa học protein và toán học. Những tuyên bố đó rất khó kiểm tra: kết quả khoa học được xác nhận chậm và sự nhiệt tình chuyển động nhanh hơn so với việc nhân rộng. Một tiêu chuẩn chấm điểm các thành phần có thể kiểm chứng được trên quy trình công việc thực tế mang lại cho các tổ chức nghiên cứu một cách để tách khả năng đã được chứng minh khỏi sân khấu trình diễn — và để theo dõi, phát hành lần lượt từng bản phát hành, xem liệu tiến bộ tác nhân trong khoa học có tăng trưởng nhanh như trong công nghệ phần mềm hay không, nơi Terminal-Bench lần đầu tiên làm nên tên tuổi của nó.

Đối với ngành AI, thông điệp của v0.1 có tính chất hai lưỡi. Giới hạn rõ ràng đang tiến lên — 30% của Opus 5 cao hơn 10,5% của Opus 4.8 cũ — nhưng mức trần vẫn còn xa so với độ tin cậy mà các phòng thí nghiệm thực sự yêu cầu. Các nhà thiết kế điểm chuẩn cho biết các bản phát hành thường xuyên sẽ theo dõi chính xác khoảng cách đó được thu hẹp nhanh như thế nào. Các nhà khoa học theo dõi các xu hướng AI mới nổi trong các công cụ nghiên cứu tác nhân hiện đã có một thước đo mà họ tự xây dựng.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →