GPT-6 Astra ของ OpenAI อาจประสบปัญหาความน่าเชื่อถือของผู้ใช้ในด้านการเขียนโค้ด แต่ในเกณฑ์มาตรฐานด้านวิทยาการหุ่นยนต์ใหม่ มีการโพสต์ตัวเลขที่นักวิจัยพูดถึงการก้าวกระโดดเชิงคุณภาพ บน StationeryBench ซึ่งเป็นการทดสอบที่สร้างขึ้นโดยใช้วัตถุบนโต๊ะทั่วไป Astra ทำงานได้สำเร็จ 7 รายการจาก 100 งาน ในขณะที่ MolmoAct2 ของ Ai2 ซึ่งเป็นโมเดลที่ต้องเผชิญกับการทดสอบนั้นทำสำเร็จเป็นศูนย์
เกณฑ์มาตรฐานซึ่งอธิบายโดย The Decoder นั้น จะนำโมเดลทั้งสองมาต่อกันในงานวัตถุบนโต๊ะ 5 ชิ้น ได้แก่ การแกะเครื่องหมายออก การเทคลิปหนีบกระดาษ หรือการส่งไม้บรรทัดระหว่างแขนหุ่นยนต์ทั้งสอง ทั้งสองรุ่นควบคุมหุ่นยนต์ YAM แขนคู่ตัวเดียวกันในการทดลอง 200 ครั้ง การออกแบบการควบคุมมีจุดประสงค์เพื่อแยกความสามารถของโมเดลออกจากความแตกต่างของฮาร์ดแวร์ ผลลัพธ์ วิดีโอ และโค้ดทั้งหมดได้รับการเผยแพร่บน GitHub หากต้องการรายงานการวิจัยเพิ่มเติมในลักษณะนี้ โปรดไปที่ AI news hub ของเรา
'การเปลี่ยนแปลงขั้นตอน' ตามที่นักวิจัยระบุ
Yoav Artzi นักวิจัย AI ที่ Cornell และ Google DeepMind เรียกประสิทธิภาพของ Astra ว่าเป็น "การเปลี่ยนแปลงขั้นตอนในการให้เหตุผลเชิงพื้นที่" ซึ่งเป็นผลการวัดประสิทธิภาพภาษาที่หาได้ยาก ในเกณฑ์มาตรฐานที่ยังไม่ได้เผยแพร่ที่เรียกว่า REMAP นั้น Astra มีความแม่นยำใกล้เคียงกับระดับมนุษย์ แม้ว่า Artzi จะตั้งข้อสังเกตว่า "แม้แต่ Astra ก็ไม่เข้าใจสิ่งที่มนุษย์ทำในสถานการณ์อื่น"
คะแนนเฉลี่ยความคืบหน้าของ Astra อยู่ที่ 46 เต็ม 100 เทียบกับ 12 คะแนนสำหรับ MolmoAct2 ซึ่งเป็นช่องว่างที่สำคัญมากกว่าตัวเลขที่พาดหัวข่าวที่เสร็จสมบูรณ์แนะนำ งานด้านวิทยาการหุ่นยนต์จะให้คะแนนตามความคืบหน้าบางส่วนและความสำเร็จทั้งหมด และคะแนนมัธยฐานของคู่แข่งที่เพิ่มขึ้นสามเท่าบ่งชี้ว่าแบบจำลองกำลังก้าวหน้าต่อไปอย่างต่อเนื่องผ่านลำดับการจัดการ แทนที่จะประสบความสำเร็จโดยโชคจากการทดลองเพียงไม่กี่ครั้ง
เหตุใดการใช้เหตุผลเชิงพื้นที่จึงมีความสำคัญอย่างกะทันหัน
ผลลัพธ์บอกเป็นนัยว่า Astra ได้รับการฝึกฝนอย่างไร Artzi สงสัยว่า OpenAI ฝึกฝนโมเดลกับข้อมูล 3 มิติจำนวนมาก เช่น ฉาก Blender ซึ่งจะสอดคล้องกับจุดแข็งเฉพาะของโมเดลในงาน 3 มิติ หากการอ่านนั้นถูกต้อง แสดงว่าสภาพแวดล้อม 3 มิติสังเคราะห์ซึ่งมีราคาถูกกว่าและปลอดภัยกว่าการรวบรวมข้อมูลในโลกแห่งความเป็นจริง กำลังกลายเป็นเส้นทางสู่ความสามารถในโลกกายภาพ ซึ่งเป็นหนึ่งในปัญหาคอขวดที่ยาวนานที่สุดในด้านวิทยาการหุ่นยนต์
การออกแบบเกณฑ์มาตรฐานยังกล่าวถึงบางสิ่งบางอย่างเกี่ยวกับการประเมินหุ่นยนต์ที่กำลังมุ่งหน้าไป งานของ StationeryBench ถือเป็นงานธรรมดา เช่น การแกะเครื่องหมาย การเทคลิปหนีบกระดาษ การส่งไม้บรรทัด เนื่องจากการจัดการในชีวิตประจำวัน ไม่ใช่การแสดงภาพยนตร์ เป็นสิ่งที่แยกการสาธิตในห้องปฏิบัติการออกจากเครื่องจักรที่มีประโยชน์ การให้เกรดทั้งสองรุ่นบนฮาร์ดแวร์ YAM แบบแขนคู่เดียวกันตลอดการทดลอง 200 ครั้ง และการเผยแพร่วิดีโอทุกรายการ ถือเป็นการตั้งค่าที่โปร่งใสผิดปกติสำหรับการอ้างความสามารถที่เกี่ยวข้องกับเรือธงของห้องปฏิบัติการชายแดน
MolmoAct2 ซึ่งเป็นแบบจำลองเปรียบเทียบจาก Allen Institute for AI (Ai2) ซึ่งการทำงานใดๆ ไม่ได้ถือเป็นข้อมูลของตัวเอง โดยชี้ให้เห็นช่องว่างระหว่างแบบจำลองชายแดนสำหรับวัตถุประสงค์ทั่วไปและแบบจำลองหุ่นยนต์ที่สร้างขึ้นตามวัตถุประสงค์ไม่ได้เป็นเพียงการปิดตัวลงอีกต่อไป แต่เป็นการกลับด้าน อย่างน้อยก็ในการบงการการใช้เหตุผลอย่างหนัก
นอกจากนี้ยังสอดคล้องกับความทะเยอทะยานที่ระบุไว้ของ OpenAI: บริษัทมีแผนระยะยาวในการสร้างหุ่นยนต์สำหรับผู้บริโภคของตัวเอง ตามรายงานที่อ้างถึงโดย The Decoder โมเดลภาษาชายแดนที่สามารถให้เหตุผลเกี่ยวกับวัตถุ มือ และวิถีคือซอฟต์แวร์ครึ่งหนึ่งของระดับเสียงนั้น ครึ่งหนึ่งของฮาร์ดแวร์ยังคงไม่ได้รับการแก้ไข แต่เกณฑ์มาตรฐานเช่น StationeryBench เป็นวิธีการวัดเรื่องราวนั้น
บริบท: โมเดลที่มีสัปดาห์ที่ซับซ้อน
ผลลัพธ์เกิดขึ้นในวงจรข่าวแปลกสำหรับ OpenAI โมเดลเดียวกันที่เป็นจุดศูนย์กลางของเกณฑ์มาตรฐานนี้ใช้เวลาหนึ่งสัปดาห์เผชิญกับข้อร้องเรียนจากผู้ใช้ว่ามันโง่ขึ้นเรื่อย ๆ นับตั้งแต่เปิดตัว การร้องเรียน OpenAI สืบเนื่องมาจากข้อบกพร่องที่ระบุชื่อสามรายการ ตั้งแต่ทักษะการทำงานผิดพลาดไปจนถึงการทดสอบบริบทที่ทำงานผิดปกติ ก่อนที่จะรีเซ็ตขีดจำกัดการใช้งาน Codex แบบจำลองที่สะดุดในการผลิตขณะโพสต์ผลลัพธ์การเปลี่ยนแปลงขั้นตอนในห้องปฏิบัติการถือเป็นจุดเด่นของอุตสาหกรรม AI ในปัจจุบัน ความสามารถและความน่าเชื่อถือกำลังก้าวหน้าไปตามนาฬิกาที่ต่างกัน
นอกจากนี้ยังเกิดขึ้นท่ามกลางการอภิปรายด้านความปลอดภัยที่ผู้นำของ OpenAI เข้าร่วมด้วย หัวหน้านักวิทยาศาสตร์ของบริษัทได้เตือนว่า ไม่มีห้องปฏิบัติการใดที่สามารถแก้ปัญหาการควบคุมระบบอัตโนมัติที่เพิ่มมากขึ้นได้ และซีอีโอของ Anthropic ได้เรียกร้องให้อุตสาหกรรมนี้ชะลอการพัฒนาแนวชายแดนโดยสิ้นเชิง เกณฑ์มาตรฐานที่แสดงแบบจำลองที่บงการโลกทางกายภาพ แม้ว่าโลกจะเป็นเพียงโต๊ะที่เต็มไปด้วยเครื่องเขียนก็ตาม ถือเป็นผลลัพธ์ที่ผู้บริหารทั้งสองคนอ้างถึงเมื่อพวกเขาโต้แย้งว่าความก้าวหน้านั้นก้าวล้ำหน้าการกำกับดูแล
บรรทัดล่าง
งานที่เสร็จสมบูรณ์เจ็ดงานจากทั้งหมด 100 งานจะไม่วางหุ่นยนต์ไว้บนโต๊ะของคุณในวันพรุ่งนี้ แต่การเปลี่ยนจากศูนย์เป็น 7 ของคู่แข่ง โดยมีคะแนนเฉลี่ยความก้าวหน้าสูงกว่า 3 เท่า ถือเป็นความไม่ต่อเนื่องประเภทหนึ่งที่ปรับปรุงแผนภูมิความสามารถในการทำความเข้าใจภาษาเมื่อสองปีที่แล้ว คำถามเปิดคือโมเดลเดียวกันสามารถส่งมอบความสามารถนั้นได้อย่างน่าเชื่อถือนอกเกณฑ์มาตรฐาน ในราคาที่นักพัฒนายินดีจ่ายหรือไม่
ก้าวนำหน้า AI
เกณฑ์มาตรฐาน ความก้าวหน้า และการแข่งขันไปสู่เครื่องจักรที่ทำงาน — ติดตามทุกวัน
อ่านข่าว AI เพิ่มเติม →