มาตรฐานใหม่กำลังท้าทายวิธีที่อุตสาหกรรม AI วัดความสามารถทางวิทยาศาสตร์ และผลลัพธ์แรกก็น่าน้อยใจสำหรับห้องปฏิบัติการชายแดน Terminal-Bench-Science 0.1 ซึ่งเปิดตัวในสัปดาห์นี้โดยนักวิจัยที่มหาวิทยาลัยสแตนฟอร์ดและทีมงานที่อยู่เบื้องหลังเกณฑ์มาตรฐานการเข้ารหัส Terminal-Bench ที่ได้รับความนิยม ประเมินตัวแทน AI บนขั้นตอนการวิจัยทางวิทยาศาสตร์จริงที่นักวิทยาศาสตร์ที่ทำงานมีส่วนร่วม และแบบจำลองที่แข็งแกร่งที่สุดที่ทดสอบคือ Claude Opus 5 ที่ทำงานผ่าน Claude Code นั้นเสร็จสิ้นไปเพียง 30% ของงานทั้งหมด
หน้าประกาศของเกณฑ์มาตรฐานอธิบายหลักการชี้นำอย่างตรงไปตรงมา: นักวิทยาศาสตร์ ไม่ใช่นักพัฒนาโมเดลหรือผู้จำหน่ายข้อมูล ควรกำหนดมาตรฐานสำหรับความสามารถทางวิทยาศาสตร์ใน AI โครงการนี้สร้างขึ้นโดยความร่วมมือกับผู้เชี่ยวชาญในขอบเขตจากสถาบันการวิจัยทั่วโลก และการเปิดตัวครั้งแรกประกอบด้วย 70 งานที่ครอบคลุมเกี่ยวกับวิทยาศาสตร์เพื่อชีวิต ฟิสิกส์ วิทยาศาสตร์โลก คณิตศาสตร์ และวิศวกรรมศาสตร์
มันแตกต่างจากเกณฑ์มาตรฐานตำราเรียนอย่างไร
ความรู้ในการทดสอบการประเมิน AI ทางวิทยาศาสตร์ส่วนใหญ่: คำถามแบบปรนัย ปัญหาในตำราเรียน แบบฝึกหัดที่ได้มาตรฐาน Terminal-Bench-Science แทนที่จะวัดว่าเจ้าหน้าที่สามารถดำเนินการตามขั้นตอนการทำงานที่ต้องใช้เทคนิคและใช้เวลานานซึ่งเติมเต็มวันทำงานของนักวิจัยจริงๆ ซึ่งเป็นงานประเภทที่ไม่มีการสอบหรือไม่ งานทำงานในสภาพแวดล้อมที่สมจริง และการให้เกรดจะขึ้นอยู่กับสิ่งที่เป็นรูปธรรม เช่น การวิเคราะห์ การจำลอง การพิสูจน์ รหัส และผลิตภัณฑ์ข้อมูล ตรวจสอบด้วยการทดสอบเฉพาะงานที่สามารถทำซ้ำได้ แทนที่จะตัดสินแบบจำลองหรือการให้คะแนนแบบปรนัย
การออกแบบดังกล่าวสะท้อนให้เห็นถึงทฤษฎีว่าในที่สุดผู้ช่วย AI ควรทำเพื่อวิทยาศาสตร์อย่างไร แทนที่จะแทนที่การตัดสินทางวิทยาศาสตร์ ผู้เขียนเกณฑ์มาตรฐานโต้แย้งว่า เจ้าหน้าที่ควรเข้าควบคุมเลเยอร์การดำเนินการ — ดำเนินการทดลองในซิลิโก ประมวลผลข้อมูล การตรวจสอบข้อพิสูจน์ — เพื่อปลดปล่อยนักวิทยาศาสตร์สำหรับส่วนของการวิจัยที่การตัดสินของมนุษย์มีความสำคัญที่สุด: การตั้งคำถาม การสร้างสมมติฐาน การตีความผลลัพธ์ และการสื่อสารการค้นพบ
โครงการนี้ถูกสร้างขึ้นอย่างชัดเจนเพื่อเป็นเป้าหมายเคลื่อนที่ ในกรณีที่เกณฑ์มาตรฐานจำนวนมากถูกเผยแพร่เพียงครั้งเดียวและละทิ้ง การประกาศดังกล่าวเรียกสิ่งนี้ว่าปัญหา "เอกสารที่จะเผยแพร่" Terminal-Bench-Science ได้รับการออกแบบให้เป็นเกณฑ์มาตรฐานอย่างต่อเนื่องที่พัฒนาไปพร้อมกับขอบเขตชายแดน โดยมีการเผยแพร่เป็นประจำโดยมีจุดมุ่งหมายเพื่อให้การประเมินอยู่เหนือความคืบหน้าของแบบจำลอง และป้องกันอัตราเงินเฟ้อของคะแนนที่เกิดจากการปนเปื้อน
ลีดเดอร์บอร์ดแรก: หนทางอันยาวนานจากความน่าเชื่อถือ
กระดานผู้นำ v0.1 ซึ่งดึงดูดความสนใจอย่างมากเมื่อมาถึง Hacker News ในสัปดาห์นี้ แสดงให้เห็นว่ามีการลดลงอย่างมากจากด้านบน:
- คลอดด์บทประพันธ์ 5 (รหัสคลอด): 30.0%
- GPT-5.6 โซล (โคเด็กซ์) : 22.4%
- คลอดด์ นิทาน 5 (โค้ดคลอดด์): 21.4%
- Claude Opus 4.8 (รหัส Claude): 10.5%
- GPT-5.6 เทอร์ร่า (โคเด็กซ์) : 8.6%
- GLM 5.3 (รหัสโคลด): 8.1%
- Kimi K3 (รหัสโคลด): 7.1%
- Grok 4.6 (รุ่น Grok): 7.1%
- GPT-5.6 ลูน่า (โคเด็กซ์): 3.3%
ผลลัพธ์ชี้ให้เห็นว่าขั้นตอนการทำงานทางวิทยาศาสตร์ยังคงยากสำหรับตัวแทนมากกว่าวิศวกรรมซอฟต์แวร์ โดยที่ Terminal-Bench ดั้งเดิมและเกณฑ์มาตรฐานการเข้ารหัสของคู่แข่งได้เห็นคะแนนไต่ขึ้นอย่างรวดเร็ว อัตราความละเอียด 30% สำหรับระบบที่ดีที่สุดที่มีอยู่ หมายความว่าในงานวิจัยจริง 7 ใน 10 งาน แม้แต่เจ้าหน้าที่ระดับสูงที่จับคู่กับสายรัดที่แข็งแกร่งก็ไม่สามารถผลิตงานที่ถูกต้องอย่างตรวจสอบได้
การแพร่กระจายภายในตระกูลโมเดลก็เป็นประโยชน์เช่นกัน ช่องว่างระหว่าง Claude Opus 5 และ Claude Opus 4.8 — เกือบยี่สิบจุด — และระหว่างตัวแปร GPT-5.6 Sol, Terra และ Luna แสดงให้เห็นว่าคุณภาพของผลลัพธ์มากน้อยเพียงใดขึ้นอยู่กับการทำงานร่วมกันของโมเดลและการควบคุมของเจ้าหน้าที่ ไม่ใช่ความฉลาดของโมเดลดิบเพียงอย่างเดียว ทุกรายการที่มีคะแนนสูงใช้สายรัดการเข้ารหัสแบบเอเจนต์ (Claude Code, Codex, Grok Build) ซึ่งตอกย้ำฉันทามติที่เกิดขึ้นใหม่ว่าโครงนั่งร้านนั้นมีความสำคัญพอ ๆ กับน้ำหนักพื้นฐาน
เหตุใดนักวิทยาศาสตร์จึงสร้างเกณฑ์มาตรฐานของตนเอง
กรอบของเกณฑ์มาตรฐานมีข้อโต้แย้งเชิงสถาบันที่ละเอียดอ่อน ประกาศดังกล่าวระบุว่า “เดิมพันทางวิทยาศาสตร์นั้นสูงเกินไป และเกณฑ์มาตรฐานจะต้องสะท้อนถึงลำดับความสำคัญของชุมชนวิทยาศาสตร์มากกว่าผลประโยชน์ภายนอก” โครงการนี้ช่วยให้นักวิจัยที่ทำงานมีกลไกโดยตรงในการเข้ารหัสงานที่พวกเขาต้องการโดยอัตโนมัติ และเพื่อระงับคำกล่าวอ้างของผู้ขายที่ว่า "การเร่งการค้นพบทางวิทยาศาสตร์" เทียบกับมาตรฐานที่ตรวจสอบได้
นั่นสำคัญเพราะช่องว่างระหว่างการตลาดและความเป็นจริงมีผลกระทบที่แท้จริง หากห้องปฏิบัติการชายแดนอ้างว่าตัวแทนของตนสามารถเร่งการวิจัยได้ในขณะที่การประเมินที่เป็นอิสระและออกแบบโดยผู้เชี่ยวชาญจะแสดงอัตราการแก้ไขปัญหาด้วยตัวเลขหลักเดียวถึง 30% การตัดสินใจด้านเงินทุน แผนการจ้างงาน และนโยบายห้องปฏิบัติการที่สร้างขึ้นจากการกล่าวอ้างเหล่านั้นสืบทอดข้อผิดพลาด การวัดประสิทธิภาพที่ต่อเนื่องและเป็นของชุมชนเป็นแนวทางแก้ไขประการหนึ่ง โดยจะแปลงการกล่าวอ้างที่คลุมเครือให้เป็นตัวเลขที่ทำซ้ำได้
สัญญาณสำหรับสถาบันวิจัย
สำหรับมหาวิทยาลัย ห้องปฏิบัติการระดับชาติ และทีม R&D ที่ชั่งน้ำหนักว่าเมื่อใดที่จะต้องปรับใช้ตัวแทน เกณฑ์มาตรฐานนำเสนอสิ่งที่ผู้ขายสาธิตไม่สามารถทำได้: การวัดที่ดูแลโดยชุมชนว่าบรรทัดความน่าเชื่อถืออยู่ตรงไหนจริงๆ อัตราการแก้ปัญหาในช่วงวัยรุ่นหรือวัย 20 หมายความว่าระบบเหล่านี้ได้รับการปฏิบัติอย่างดีที่สุดในปัจจุบันในฐานะผู้ช่วยที่ต้องมีการตรวจสอบ ไม่ใช่ในฐานะผู้ดำเนินการไปป์ไลน์ทดลองโดยอิสระ หมวดหมู่งาน — ครอบคลุมชีวิต กายภาพ โลก คณิตศาสตร์ และวิทยาศาสตร์วิศวกรรม — ยังช่วยให้ผู้เชี่ยวชาญโดเมนมีเทมเพลตสำหรับสนับสนุนเวิร์กโฟลว์จากสาขาที่เกณฑ์มาตรฐานทั่วไปมองข้ามอยู่เป็นประจำ
บริบททางอุตสาหกรรมที่กว้างขึ้นตอกย้ำว่าเหตุใดเรื่องเวลาจึงมีความสำคัญ วิทยาศาสตร์ได้กลายเป็นหนึ่งในกรณีการใช้งาน AI แนวหน้าที่ได้รับการส่งเสริมมากที่สุด โดยห้องปฏิบัติการต่างๆ ต่างก็มีส่วนร่วมในการค้นพบวัสดุ วิทยาศาสตร์โปรตีน และคณิตศาสตร์ คำกล่าวอ้างเหล่านี้ตรวจสอบได้ยาก เนื่องจากผลลัพธ์ทางวิทยาศาสตร์ตรวจสอบได้ช้า และความกระตือรือร้นดำเนินไปเร็วกว่าการจำลองแบบ เกณฑ์มาตรฐานที่ให้คะแนนสิ่งประดิษฐ์ที่ตรวจสอบได้บนเวิร์กโฟลว์จริงทำให้สถาบันการวิจัยมีวิธีแยกความสามารถที่แสดงให้เห็นออกจากโรงละครสาธิต และเพื่อติดตาม เผยแพร่ทีละเผยแพร่ ไม่ว่าความก้าวหน้าทางวิทยาในวิทยาศาสตร์กำลังก่อตัวอย่างรวดเร็วพอๆ กับในวิศวกรรมซอฟต์แวร์หรือไม่ ซึ่ง Terminal-Bench ได้สร้างชื่อขึ้นมาเป็นครั้งแรกหรือไม่
สำหรับอุตสาหกรรม AI ข้อความของเวอร์ชัน 0.1 นั้นเป็นแบบสองด้าน ขอบเขตกำลังก้าวหน้าอย่างเห็นได้ชัด - หอคอย 30% ของ Opus 5 สูงกว่า Opus 4.8 รุ่นเก่า 10.5% - แต่เพดานยังห่างไกลจากความน่าเชื่อถือที่ห้องปฏิบัติการจริงต้องการ นักออกแบบของเกณฑ์มาตรฐานกล่าวว่าการเปิดตัวเป็นประจำจะติดตามได้อย่างแม่นยำว่า Gap นั้นปิดเร็วแค่ไหน นักวิทยาศาสตร์ที่เฝ้าดู เทรนด์ AI ที่กำลังเติบโต ในเครื่องมือวิจัยเชิงตัวแทนตอนนี้มีเกณฑ์มาตรฐานที่พวกเขาสร้างขึ้นเองแล้ว
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →