OpenAI กำลังถอยกลับหลังจาก Claude Opus 5 ของ Anthropic ครองเกณฑ์มาตรฐาน ARC-AGI-3 โดยเผยแพร่ผลลัพธ์ที่แสดงรุ่น GPT-5.6 Sol ของตัวเองสูงถึง 38.3 เปอร์เซ็นต์ - หากคุณใช้การตั้งค่าที่ต้องการของ OpenAI แทนที่จะเป็นชุดทดสอบอย่างเป็นทางการ

ข้อพิพาทซึ่งเกิดขึ้นเมื่อวันที่ 30 กรกฎาคม พ.ศ. 2569 ได้ตัดประเด็นสำคัญของปัญหาที่เพิ่มขึ้นในการประเมิน AI: การวัดประสิทธิภาพไม่ได้วัดเพียงแบบจำลองอีกต่อไป แต่โครงข่ายทางเทคนิคทั้งหมดล้อมรอบอยู่ เพื่อการวิเคราะห์เชิงลึก การพัฒนา AI ล่าสุด และการเผยแพร่โมเดล AI Buzz Wire กำลังติดตามเรื่องราว

ตัวเลขและการจับ

OpenAI รายงานว่า GPT-5.6 Sol สูงถึง 38.3 เปอร์เซ็นต์ใน ARC-AGI-3 ซึ่งแซงหน้า Claude Opus 5 ของ Anthropic ซึ่งทำคะแนนได้ 30.2 เปอร์เซ็นต์ หลังจากที่ทำสถิติใหม่เป็นสี่เท่าก่อนหน้านี้ ข้อแม้มีความสำคัญ: ตัวเลข 38.3 เปอร์เซ็นต์นั้นขึ้นอยู่กับคุณสมบัติเฉพาะสองประการของ Responses API ของ OpenAI

ประการแรกคือ การใช้เหตุผลแบบคงอยู่ ซึ่งรักษาห่วงโซ่ความคิดของแบบจำลองระหว่างขั้นตอนต่างๆ แทนที่จะละทิ้งไปหลังจากการกระทำแต่ละอย่าง ประการที่สองคือ การบดอัด ซึ่งสรุปบริบทที่เก่ากว่าแทนที่จะตัดทอน ทำให้โมเดลสามารถจัดการกับปัญหาที่ยาวนานต่อไปได้โดยไม่สูญเสียเหตุผลก่อนหน้านี้

ดำเนินการผ่านสายรัดที่ได้มาตรฐานอย่างเป็นทางการของ ARC Prize ซึ่งจงใจหลีกเลี่ยงการตั้งค่าเฉพาะของผู้ให้บริการเพื่อให้แน่ใจว่ามีการเปรียบเทียบระหว่างแอปเปิ้ลกับแอปเปิ้ล GPT-5.6 Sol จัดการได้เพียง 7.8 เปอร์เซ็นต์ เหตุผลที่ OpenAI ให้เหตุผลก็คือ การตั้งค่าอย่างเป็นทางการจะละทิ้งเหตุผลของโมเดลหลังจากทุกขั้นตอน ส่งผลให้ประสิทธิภาพการทำงานที่ต้องอาศัยการคิดหลายขั้นตอนอย่างต่อเนื่อง

เกณฑ์มาตรฐานที่สร้างขึ้นเพื่อความบริสุทธิ์

ARC-AGI-3 ได้รับการออกแบบโดย François Chollet และทีมงาน ARC Prize เพื่อตรวจสอบความสามารถของแบบจำลองในการแก้ปริศนาการให้เหตุผลใหม่ๆ ที่ไม่เคยเห็นมาก่อน ซึ่งเป็นการทดสอบความฉลาดทั่วไปมากกว่าความรู้ที่จดจำ เพื่อให้การเปรียบเทียบมีความยุติธรรม ชุดควบคุมอย่างเป็นทางการจงใจตัดคุณลักษณะเฉพาะของผู้ให้บริการออกไป โดยวัดความสามารถของโมเดลดิบในสภาพแวดล้อมที่เป็นกลาง

ข้อโต้แย้งของ OpenAI ก็คือความเป็นกลางนี้อาจกลายเป็นอุปสรรคได้ บริษัทยืนยันว่าการควบคุมอย่างเป็นทางการอาศัย "API การสำเร็จรูปแบบ OpenAI" รุ่นเก่าซึ่งขาดความสามารถที่ Claude API นำเสนออยู่แล้ว ส่งผลให้ OpenAI มีข้อเสียด้านโครงสร้างเมื่อเทียบกับ Anthropic ในการเปรียบเทียบดั้งเดิมอย่างมีประสิทธิภาพ

โดยพื้นฐานแล้ว OpenAI พูดว่า: คุณวัดแบบจำลองของเราด้วยมือข้างเดียวผูกไว้ด้านหลัง

คำตอบของ Chollet

François Chollet ผู้ร่วมก่อตั้ง ARC Prize โต้ตอบด้วยการวาดเส้นแบ่งที่ชัดเจนระหว่างการตั้งค่าการทดสอบสองประเภท สายรัด "สั่งทำพิเศษเพื่อแก้ไขเกณฑ์มาตรฐานหรือมีความรู้เกี่ยวกับรูปแบบเกณฑ์มาตรฐาน" นั้นอยู่นอกขอบเขต เขากล่าว แต่การตั้งค่า API สำหรับการใช้งานทั่วไป "ที่ไม่ได้พัฒนาขึ้นสำหรับ ARC-AGI-3 และที่พร้อมใช้งานสำหรับผู้ใช้ API ทุกคน" ถือเป็นเกมที่ยุติธรรม

Chollet ยอมรับว่าคะแนน GPT-5.6 Sol ของ ARC Prize ทำให้ OpenAI เสียเปรียบ เขาตั้งข้อสังเกตว่าองค์กรมี "การพูดคุยไปมามากมายกับ OpenAI เกี่ยวกับวิธีทดสอบโมเดลให้ดีที่สุด โดยเฉพาะอย่างยิ่งในเรื่องของการบดอัด" และยินดีที่บริษัท "เริ่มหาคำตอบ"

Chollet แจ้งข้อกังวลหนึ่งข้อที่เหลืออยู่ ผู้ให้บริการแต่ละรายที่ใช้การตั้งค่าที่แตกต่างกันจะสร้างสิ่งที่เขาเรียกว่า "ปัญหาความเท่าเทียมกันที่อาจเกิดขึ้น" — แต่เขาเห็นว่ายอมรับได้ "ตราบใดที่การตั้งค่าและต้นทุนได้รับการรายงานอย่างชัดเจน"

เหตุใดจึงมีความสำคัญนอกเหนือจากลีดเดอร์บอร์ด

ตอนนี้เน้นย้ำถึงความตึงเครียดที่กำลังเปลี่ยนรูปแบบวิธีที่อุตสาหกรรม AI ประเมินความคืบหน้า เนื่องจากมีการใช้งานโมเดลผ่าน API ที่มีคุณสมบัติหลากหลายมากขึ้นเรื่อยๆ แทนที่จะเป็นระบบแบบสแตนด์อโลน เส้นแบ่งระหว่างความสามารถโดยธรรมชาติของโมเดลและวิศวกรรมรอบๆ ตัวโมเดลจึงเบลออยู่เสมอ เกณฑ์มาตรฐานที่เพิกเฉยต่อโครงอาจดูด้อยประสิทธิภาพในโลกแห่งความเป็นจริง ผู้ที่ยอมรับมันอาจจะให้รางวัลแก่บริษัทที่ทำการทดสอบ

การอภิปราย ARC-AGI-3 ไม่น่าจะถือเป็นการอภิปรายครั้งสุดท้าย เนื่องจากโมเดลระดับแนวหน้ากระจุกตัวอยู่ใกล้จุดสูงสุดของเกณฑ์มาตรฐานที่กำหนดไว้ ความขัดแย้งเกี่ยวกับสิ่งที่นับเป็นการวัดที่ยุติธรรม และการควบคุมของผู้ที่จะกำหนดมาตรฐาน จะยิ่งทวีความรุนแรงมากขึ้นเท่านั้น

ก้าวนำหน้า AI

ต้องการติดตาม ข่าวด่วน AI เกี่ยวกับโมเดล เกณฑ์มาตรฐาน และห้องทดลองที่สร้างสิ่งเหล่านี้หรือไม่ AI Buzz Wire ช่วยคุณได้

อ่านข่าว AI เพิ่มเติม