GPT-6 Astra ของ OpenAI ได้โพสต์ผลลัพธ์ที่ล้ำสมัยบน ARC-AGI-3 ซึ่งเป็นเกณฑ์มาตรฐานการให้เหตุผลเชิงนามธรรมที่ออกแบบมาเพื่อวัดความฉลาดทางการรับรู้ ตามผลลัพธ์ที่เผยแพร่เมื่อวันพุธโดย ARC Prize Foundation แบบจำลองได้คะแนน 62.7% ในชุดเกณฑ์มาตรฐานแบบกึ่งส่วนตัวของแบบจำลองภายใต้สายรัดมาตรฐานของมูลนิธิ และ 99.9% เมื่อประเมินด้วยสายรัดอะแดปเตอร์ของผู้ให้บริการที่จะรักษาสถานะการให้เหตุผลภายในของแบบจำลองระหว่างคำขอต่างๆ

ผลลัพธ์เกิดขึ้นหนึ่งวันหลังจาก OpenAI เริ่มเปิดตัว Astra แบบเป็นขั้นเป็นตอน ซึ่งเป็นรุ่นเรือธงที่บริษัทตั้งเป้าไว้ว่าเป็นการเริ่มต้นยุคใหม่ สำหรับผู้อ่านที่พยายามรักษาคะแนนไว้ในขณะที่ห้องปฏิบัติการชายแดนทำลายมาตรฐาน หน้า การพัฒนา AI ล่าสุด จะติดตามการเปิดตัวครั้งสำคัญทุกครั้งที่เกิดขึ้น

สายรัดสองอัน สองคะแนนที่แตกต่างกันมาก

ช่องว่างระหว่างตัวเลขพาดหัวทั้งสองของ Astra คือรายละเอียดที่สำคัญที่สุดในรายงาน ARC Prize ประเมินตัวแทนภายใต้การควบคุมที่แตกต่างกัน และแต่ละอย่างจะเปลี่ยนแปลงสิ่งที่โมเดลได้รับอนุญาตให้ทำกับบริบทของตัวเอง

ภายใต้สายรัดมาตรฐาน โมเดลสามารถพกพาบันทึกที่เลือกเก็บไว้ขณะทำงานผ่านสภาพแวดล้อมได้ ด้วยการตั้งค่าดังกล่าว Astra ที่ใช้ความพยายามในการให้เหตุผลสูงสุดได้คะแนน 62.7% โดยมีต้นทุนรวม 26,098 ดอลลาร์สำหรับการดำเนินการประเมิน ในทางกลับกัน การใช้สายรัดแบบเดียวกันโดยปิดการใช้เหตุผลนั้นทำได้เพียง 35.2% ในขณะที่มีราคาสูงกว่า — 49,791 ดอลลาร์ — เนื่องจากโมเดลต้องการการดำเนินการเพิ่มเติมมากมายเพื่อให้ก้าวหน้า

ชุดสายรัดอะแดปเตอร์ของผู้ให้บริการมีความกว้างขวางมากขึ้น โดยจะรักษาสถานะการให้เหตุผลแบบทึบของโมเดลระหว่างคำขอ และใช้การบีบอัดเพื่อการสนทนาที่ยาวนานขึ้น โดยปล่อยให้ Astra นำกลับมาใช้ใหม่ก่อนการทำงาน ภายใต้การควบคุมนั้น แอสตร้าทำคะแนนได้ 99.9% จากความพยายามในการให้เหตุผลสูงด้วยเงิน 18,817 ดอลลาร์ และ 98.6% จากความพยายามสูงสุดด้วยเงิน 17,332 ดอลลาร์ แม้แต่การตั้งค่าการให้เหตุผลขั้นต่ำก็สูงถึง 96.7%

กล่าวอีกนัยหนึ่ง ความแตกต่างระหว่างคะแนนบางส่วนและคะแนนที่ใกล้สมบูรณ์แบบนั้นไม่ใช่ความสามารถดิบเพียงอย่างเดียว แต่อยู่ที่ว่าสถานะการทำงานของแบบจำลองจะคงอยู่ได้มากน้อยเพียงใดระหว่างขั้นตอนต่างๆ

เอาชนะมนุษย์ด้วยประสิทธิภาพในการดำเนินการ

ARC-AGI-3 สร้างขึ้นจากสภาพแวดล้อมเกมแบบผลัดตาที่แปลกใหม่และเป็นนามธรรม เจ้าหน้าที่จะต้องสำรวจโดยไม่มีคำแนะนำ สรุปวิธีการทำงานของโลก ระบุเป้าหมายจากรางวัลที่กระจัดกระจาย และวางแผนการดำเนินการหลายขั้นตอน สภาพแวดล้อมได้รับการปรับเทียบเพื่อให้มนุษย์สามารถแก้ปัญหาได้ 100% ซึ่งทำให้ประสิทธิภาพของมนุษย์เป็นเกณฑ์พื้นฐานในการวัดเกณฑ์มาตรฐาน

Astra ไม่เพียงแต่แก้ด่านส่วนใหญ่เท่านั้น แต่ยังแก้ปัญหาได้อย่างมีประสิทธิภาพอีกด้วย จากข้อมูลของ ARC Prize โมเดลดังกล่าวใช้การกระทำน้อยกว่าค่ามัธยฐานที่ทดสอบโดยมนุษย์ในระดับ 96% ซึ่งเหนือกว่าพื้นฐานของมนุษย์ในด้านประสิทธิภาพการดำเนินการทั่วทั้งฉาก

เศรษฐศาสตร์ของการเปรียบเทียบนั้นสิ้นเชิง ผู้เข้าร่วมการทดสอบโดยมนุษย์ได้รับเงิน 115 ดอลลาร์ต่อเซสชั่น 90 นาที บวก 5 ดอลลาร์ต่อเกมที่เสร็จสมบูรณ์ ซึ่งคิดเป็นเงินประมาณ 12.78 ดอลลาร์ต่อเกมที่พยายามเล่น การประเมิน Astra แบบเต็มมีค่าใช้จ่ายห้าหลัก ขึ้นอยู่กับการกำหนดค่า แต่ ARC Prize สังเกตเห็นริ้วรอยที่ขัดกับสัญชาตญาณ: โดยทั่วไปแล้ว ความพยายามในการให้เหตุผลที่สูงกว่ามักจะเสียค่าใช้จ่ายน้อยลง เนื่องจาก Astra แก้ไขเกมด้วยการดำเนินการน้อยลง ส่งผลให้จำนวนการเรียกโมเดลและโทเค็นที่ถูกเผาทั้งหมดต่อการรันลดลง

โมเดลที่สร้างภาษาของตัวเอง

นอกเหนือจากคะแนนที่ได้รับแล้ว ARC Prize ยังเน้นย้ำถึงพฤติกรรมเชิงคุณภาพที่ทีมงานสังเกตเห็น Astra เปลี่ยนสภาพแวดล้อมที่ไม่คุ้นเคยให้กลายเป็นโมเดลโลกเชิงสัญลักษณ์ขนาดกะทัดรัดอย่างต่อเนื่อง โดยนำเสนอกลไกของเกมเป็นกฎเชิงตรรกะ และพัฒนาชวเลขเฉพาะโดเมนของตนเองเพื่อติดตามสถานะและวางแผนการดำเนินการ

นั่นคือทักษะ ARC-AGI-3 ที่ออกแบบมาเพื่อการตรวจสอบอย่างแน่นอน ในขณะที่รุ่นก่อนๆ ของเกณฑ์มาตรฐานทดสอบการให้เหตุผลแบบไหลลื่นเหนือรูปแบบใหม่ๆ รุ่นที่สามจะทดสอบว่าตัวแทนสามารถสำรวจ สร้างแบบจำลอง ตั้งเป้าหมาย และดำเนินการตามแผนในสภาพแวดล้อมที่ไม่เคยมีมาก่อนหรือไม่ — ส่วนประกอบ ARC Prize แสดงรายการเป็นการสำรวจ การสร้างแบบจำลอง การตั้งเป้าหมาย และการวางแผนและการดำเนินการ

ฉากหลังยุค AGI

ผลลัพธ์การวัดประสิทธิภาพเกิดขึ้นท่ามกลางวาทศาสตร์สูงสุดจาก OpenAI เอง ในการแถลงข่าวก่อนการเปิดตัวในวันพฤหัสบดี Greg Brockman ประธานบริษัทกล่าวว่า “ไม่ใช่เรื่องไม่มีเหตุผลที่จะรู้สึกว่าตอนนี้เราอยู่ในยุค AGI” ในขณะที่หยุดการประกาศอย่างเป็นทางการ ตามการรายงานข่าวของ The New Stack เขาอธิบายว่า AGI เป็น "แนวคิดภารกิจหรือแนวคิดทางจิตวิญญาณ" มากกว่าที่จะเป็นตัวกระตุ้นตามสัญญา

Aidan Clark นักวิจัยของ OpenAI กล่าวว่า Astra เป็นการดำเนินการฝึกอบรมที่ใหญ่ที่สุดของบริษัทจนถึงปัจจุบัน โดยเป็นการฝึกล่วงหน้าครั้งแรกกับ GPU มากกว่า 100,000 ตัวที่ไซต์ Stargate ในเท็กซัส และเป็น OpenAI รุ่นแรกที่รุ่นก่อนหน้านี้มีบทบาทสำคัญในการควบคุมดูแลกระบวนการฝึกอบรม การเข้าถึงยังคงอยู่ในขั้น: การเปิดตัวเริ่มต้นด้วยลูกค้าองค์กรในโปรแกรม Daybreak พร้อมด้วยความพร้อมใช้งาน Plus, Pro, Business และ Enterprise รวมถึงการเข้าถึง API และ AWS ที่สัญญาไว้ในอีกไม่กี่วันข้างหน้า

เครื่องหมายดอกจันบนคะแนน

ข้อควรระวังมีการรับประกันในหลายด้าน ประสิทธิภาพของ ARC-AGI-3 ของ Astra ขึ้นอยู่กับการกำหนดค่าชุดบังเหียนอย่างมาก ดังที่ตัวเลขพาดหัวทั้งสองแสดง และชุดบังเหียนแบบกำหนดเองที่รักษาสถานะของโมเดลไว้เป็นจุดโต้แย้งที่เกิดซ้ำในข้อพิพาทด้านเกณฑ์มาตรฐาน การวิเคราะห์การเปิดตัวของ New Stack ระบุว่า Astra "ได้รับผลประโยชน์มหาศาลจากงานเฉพาะทาง แต่มาในรูปแบบพรีเมียมและไม่ได้เป็นผู้นำกลุ่มการเข้ารหัสอย่างชัดเจน" ซึ่งเป็นเครื่องเตือนใจว่าการวัดประสิทธิภาพปริศนาแบบเอเจนต์และปริมาณงานเชิงพาณิชย์ในแต่ละวันจะวัดสิ่งต่าง ๆ

ARC Prize กำหนดกรอบการออกกำลังกายเป็นการวัด "ช่องว่างที่เหลือ" ระหว่าง AI และ AGI ในปัจจุบัน โดยให้คำนิยาม AGI ว่าเป็นความสามารถในการได้รับทักษะใดๆ ที่มนุษย์สามารถทำได้ มีประสิทธิภาพมากที่สุดเท่าที่มนุษย์สามารถทำได้ คะแนนที่เกือบสมบูรณ์แบบภายใต้เงื่อนไขที่เอื้ออำนวยไม่สามารถปิดช่องว่างนั้นได้ด้วยตัวเอง และที่ราคา 17,000 ถึง 50,000 ดอลลาร์สหรัฐฯ ต่อการดำเนินการประเมิน มีเพียงห้องปฏิบัติการที่มีทรัพยากรเพียงพอเท่านั้นที่จะสามารถทำการวัดประสิทธิภาพในระดับนี้ได้ แม้ว่าข้อมูลต้นทุนของ ARC Prize จะแสดงให้เห็นว่าการใช้เหตุผลที่ชาญฉลาดกว่าสามารถลดค่าใช้จ่ายลงได้ก็ตาม

ทำไมมันถึงสำคัญ

ประสิทธิภาพการดำเนินการถือเป็นแกนเปรียบเทียบใหม่อย่างแท้จริง โมเดลที่แก้ปัญหาได้ทุกระดับแต่เสียสายหลายพันสายในการทำสิ่งนี้มีประโยชน์น้อยกว่าและมีราคาแพงกว่าแบบจำลองที่กระทำเหมือนที่ Astra ทำที่นี่ นั่นคือ การสำรวจอย่างตั้งใจ บีบอัดสิ่งที่เรียนรู้ และดำเนินการกับมัน ไม่ว่าใครจะสรุปเกี่ยวกับการอภิปราย AGI ก็ตาม ข้อมูล ARC Prize แสดงให้เห็นว่าขณะนี้ตัวแทนระดับแนวหน้ากำลังจับคู่มนุษย์ ไม่ใช่แค่ว่าพวกเขาสามารถแก้ไขปัญหาใหม่ๆ ได้หรือไม่ แต่ยังขึ้นอยู่กับวิธีที่พวกเขาแก้ปัญหาได้ในเชิงเศรษฐกิจด้วย

ก้าวนำหน้า AI

ติดตามผลการวัดประสิทธิภาพ การเปิดตัวโมเดล และการถกเถียงด้านความปลอดภัยทุกรายการ — อ่านข่าว AI เพิ่มเติม →