Sakana AI ได้เผยแพร่ "Beyond Imitation" ซึ่งเป็นรายงานการวิจัยในวารสาร Transactions on Machine Learning Research (TMLR) ซึ่งอธิบายถึงระบบการตรวจสอบโดยผู้ทรงคุณวุฒิที่ได้รับความช่วยเหลือจาก LLM ซึ่งสร้างขึ้นจากการตรวจจับข้อผิดพลาดมากกว่าการเลียนแบบการตรวจสอบโดยมนุษย์ MarkTechPost รายงานเมื่อวันที่ 10 ตุลาคม คำถามหลักที่ห้องปฏิบัติการในโตเกียวตั้งเป้าที่จะตอบ: แทนที่จะให้คะแนนผู้ตรวจสอบ AI ว่าผลลัพธ์ของมันตรงกับการตรวจสอบของมนุษย์มากน้อยเพียงใด จะสามารถค้นหาข้อผิดพลาดที่เกิดขึ้นได้หรือไม่

ทีมงานได้จัดส่งสิ่งประดิษฐ์สองชิ้น ได้แก่ เกณฑ์มาตรฐานความขัดแย้งสำหรับการวัดการตรวจจับข้อผิดพลาด และระบบ Multi-Layered Review (MLR) ที่เป็นผู้นำการทดสอบพื้นฐานทุกรายการ ผลลัพธ์ดังกล่าวเกิดขึ้นท่ามกลางความสนใจที่เพิ่มขึ้นในการใช้ AI เพื่อสนับสนุนการตรวจสอบโดยผู้ทรงคุณวุฒิ ซึ่งเป็นกระบวนการที่ตึงเครียดจากปริมาณการส่งผลงานที่เพิ่มขึ้น หากต้องการข้อมูลเพิ่มเติมว่า AI กำลังปรับเปลี่ยนการวิจัยอย่างไร โปรดติดตาม การพัฒนา AI ล่าสุด ของเรา

เกณฑ์มาตรฐานของข้อผิดพลาดที่ปลูกไว้

เกณฑ์มาตรฐานความขัดแย้งจะระบุข้อผิดพลาดลงในเอกสารจริง และตรวจสอบว่าผู้ตรวจสอบตรวจพบข้อผิดพลาดเหล่านั้นหรือไม่ นักวิจัยได้รวบรวมเอกสารที่ได้รับใบอนุญาต CC จำนวน 257 ฉบับจาก ACL, AISTATS, CVPR และ ICML 2025 รวมถึง NeurIPS 2024 จากนั้นจึงใช้ Gemini 2.5 Pro เพื่อสร้างกราฟความรู้เกี่ยวกับการกล่าวอ้าง หลักฐาน และวิธีการของรายงานแต่ละฉบับ

ความรุนแรงถูกกำหนดไว้ในเชิงโครงสร้าง: ระยะห่างของโหนดจาก "การกล่าวอ้างหลัก" ของกระดาษจะกำหนดว่าข้อผิดพลาดอยู่ตรงกลางเพียงใด ระยะทางเป็นศูนย์กระทบกับการอ้างสิทธิ์หลัก ระยะทางที่มากขึ้นกระทบกับรายละเอียดสนับสนุน จากนั้น GPT-4.1 จะเขียนใหม่หนึ่งโหนดต่อระยะทางให้เกิดความขัดแย้ง โดยสร้างจุดข้อมูลทั้งหมด 1,164 จุด กรรมการ o3 จะให้คะแนนแต่ละบทวิจารณ์สิบครั้ง ในเอกสารที่สะอาด ผู้ตัดสินมีความแม่นยำ 99.9% และแสดงความไว 86.8% ในการจับที่ยืนยันด้วยตนเอง ซึ่งหมายความว่าคะแนนการตรวจจับที่รายงานอาจเป็นแบบอนุรักษ์นิยม

รีวิวแบบหลายชั้นทำงานอย่างไร

MLR เป็นระบบเอเจนต์ที่เข้าใจบทความก่อนที่จะวิจารณ์ โดยประกอบขึ้นจากตัวแทนพิเศษ 3 รายที่ทำงานบนโมเดล Claude ที่มีจำหน่ายทั่วไป — ไม่ต้องใช้คลัสเตอร์ GPU และไม่จำเป็นต้องปรับแต่งอย่างละเอียด:

  • Appendix Agent (Claude Haiku 3.5): สรุปการทดลองและรายละเอียดการดำเนินการจากภาคผนวก
  • ตัวแทนตรวจสอบวรรณกรรม (Claude Sonnet 4, ตัวเลือก): ใช้การค้นหาเว็บเพื่อวางรายงานในบริบทของงานก่อนหน้า
  • ตัวแทนตรวจสอบ (Claude Sonnet 4): เรียกใช้เส้นทางพรอมต์แบบสามรอบโดยได้รับแรงบันดาลใจจาก "แนวทางแบบสามรอบ" ที่รู้จักกันดีของนักวิทยาศาสตร์คอมพิวเตอร์ S. Keshav โดยเริ่มจากโครงร่างระดับสูง จากนั้นจึงอ่านรายละเอียดเกี่ยวกับจุดอ่อน สมมติฐาน และช่องว่าง และสุดท้ายคือการรวมผลลัพธ์ของตัวแทนทั้งหมดเข้ากับจุดแข็ง จุดอ่อน คำถาม คำแนะนำ คะแนน และรายการสิ่งที่ต้องทำ

PDF จะถูกส่งต่อไปยังแบบจำลองโดยตรง ดังนั้นตัวเลขและสมการจึงสามารถประมวลผลได้ ระบบอ่านข้อความหลักได้มากถึง 10 หน้า และ Sakana ประมาณการค่าใช้จ่ายไว้ที่ประมาณ 0.47 เหรียญสหรัฐฯ ต่อบทวิจารณ์

ผลลัพธ์: การออกแบบและการเลือกรุ่นมีความสำคัญทั้งสองอย่าง

MLR เป็นผู้นำทั้งสี่ระบบที่ได้รับการทดสอบตามเกณฑ์มาตรฐาน ด้วยการรีวิวอิสระ 4 รายการ พบว่ามีความขัดแย้งในการอ้างหลัก (ระยะทางเป็นศูนย์) 73.43% และความขัดแย้งโดยรวม 40.95% พื้นฐานที่ดีที่สุดคือระบบที่เรียกว่า AgentReview จัดการการอ้างสิทธิ์หลักได้เพียง 14.81% แม้แต่การตรวจสอบ MLR เพียงครั้งเดียวก็ยังพบข้อผิดพลาดในการอ้างสิทธิ์หลักได้ถึง 60.79%

การศึกษาการระเหยจะแยกการมีส่วนร่วมของการออกแบบออกจากการเลือกแบบจำลอง การสลับ GPT-4.1 กับ Claude Sonnet 4 ภายในไปป์ไลน์การตรวจสอบที่มีอยู่ช่วยยกระดับการตรวจจับการอ้างสิทธิ์หลักจาก 14.56% เป็น 35.40% ในขณะที่การออกแบบหลายตัวแทนของ MLR เพิ่มคะแนนด้านบนอีกประมาณ 25 เปอร์เซ็นต์สำหรับการตรวจสอบครั้งเดียว ความแม่นยำในการตรวจจับจะลดลงเมื่อข้อผิดพลาดเคลื่อนออกจากข้อกล่าวอ้างหลัก ซึ่งผู้เขียนกล่าวว่าสนับสนุนการให้คะแนนความรุนแรง

รูปภาพจะมืดลงเมื่อข้อมูลในโลกแห่งความเป็นจริงยุ่งเหยิงกว่า ใน WithdrarXiv-Check ชุดเอกสาร arXiv จำนวน 211 ฉบับที่ดึงกลับจริงนั้น MLR ได้คะแนน 26.07% สำหรับการจับคู่ที่ "คล้ายกัน" และ 16.11% สำหรับการจับคู่ที่ตรงกันทุกประการ และระบบยังคงเสี่ยงต่อการถูกแทรกพร้อมท์ที่ซ่อนอยู่ในข้อความต้นฉบับ กล่าวอีกนัยหนึ่ง การอ่านเอกสารที่หดกลับจริงนั้นยากกว่าการจับข้อขัดแย้งสังเคราะห์มาก

ความหมายของ Peer Review

ประเด็นที่นำไปใช้ได้จริงมากที่สุดของการศึกษาวิจัยนี้อาจดูมีเสน่ห์น้อยที่สุด: ทั้งการออกแบบระบบและตัวเลือกแบบจำลองมีส่วนสำคัญในการตรวจจับข้อผิดพลาด และผู้ตรวจสอบที่อ่านก่อนตัดสินจะพบว่าข้อผิดพลาดร้ายแรงมากกว่าข้อผิดพลาดที่ตรงกับรูปแบบในข้อความการตรวจสอบโดยมนุษย์ ความแตกต่างดังกล่าวมีความสำคัญเนื่องจากงานก่อนหน้านี้ส่วนใหญ่เกี่ยวกับการตรวจสอบโดยใช้ AI ซึ่งได้รับการปรับให้เหมาะสมเพื่อให้สอดคล้องกับวิจารณญาณของมนุษย์ ซึ่งเป็นตัวชี้วัดที่ให้รางวัลแก่ความสอดคล้องที่ฟังดูมั่นใจมากกว่าการตรวจสอบข้อเท็จจริงอย่างแท้จริง

ผลลัพธ์ของ Sakana ไม่ได้แนะนำว่า AI พร้อมที่จะแทนที่ผู้ตัดสินที่เป็นมนุษย์ ระบบที่พลาดข้อผิดพลาดส่วนใหญ่ในเอกสารที่หดกลับของแท้ และสามารถจัดการได้ด้วยข้อความแจ้งที่ฝังไว้ จะถือเป็นเลเยอร์ช่วยเหลือที่ดีที่สุด ไม่ใช่ผู้มีอำนาจ ข้อผิดพลาดสังเคราะห์ของเกณฑ์มาตรฐานยังสะอาดกว่าความคลุมเครือทางสถิติและการตีความที่มีการโต้แย้งซึ่งครอบงำความขัดแย้งที่แท้จริงในการทบทวน ดังนั้น ประสิทธิภาพต่อความขัดแย้งที่ปลูกไว้ควรอ่านเป็นเพียงเพดาน ไม่ใช่คำมั่นสัญญา

แต่ที่ราคาประมาณ 0.47 เหรียญสหรัฐฯ ต่อการตรวจสอบ โดยมีอัตราการตรวจจับข้อผิดพลาดที่สูงที่สุดในบรรดาระบบใดๆ ที่ทดสอบ MLR ชี้ให้เห็นในระยะสั้นที่ผู้ตรวจสอบ AI จัดการกับหน้าจอผ่านครั้งแรกเพื่อหาข้อขัดแย้ง ในขณะที่ผู้ตรวจสอบที่เป็นมนุษย์มุ่งเน้นไปที่การตัดสินที่เครื่องยังคงไม่สามารถทำได้ วารสารและผู้จัดการประชุมที่ทดลองใช้การทบทวนโดยใช้ LLM มีทั้งเกณฑ์มาตรฐานสาธารณะและพื้นฐานที่แข็งแกร่งในการวัดระบบของตนเอง และหากช่องว่างระหว่าง 73.43% ถึง 14.81% ยังคงอยู่ ก็เป็นสัญญาณที่ชัดเจนว่าสถาปัตยกรรมการอ่านมีความสำคัญมากกว่าขนาดแบบจำลองดิบ

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →