OpenAI ได้แก้ไขข้อบกพร่องสามประการที่อธิบายว่าอธิบายหนึ่งสัปดาห์ของการร้องเรียนของผู้ใช้ว่า GPT-6 Astra ซึ่งเป็นรุ่นชายแดนใหม่ล่าสุดนั้นโง่เขลามากขึ้นนับตั้งแต่เปิดตัว และกำลังรีเซ็ตขีดจำกัดการใช้งานสำหรับสมาชิก Codex เพื่อเป็นการขอโทษ การอัปเดตนี้มาจากหัวหน้าผลิตภัณฑ์ Codex Tibo Sottiaux ซึ่งกล่าวว่าทีมทำงานร่วมกับผู้ใช้เพื่อติดตามข้อผิดพลาด จากนั้นจัดส่งการแก้ไขและรีเซ็ตการใช้งานทั้งหมดก่อนเที่ยงคืนตามเวลาท้องถิ่น ตามการอัปเดตที่เผยแพร่เมื่อวันเสาร์

การรับเข้าเรียนปิดขอบเขตคร่าวๆ สำหรับสิ่งที่ OpenAI เรียกว่าเป็นโมเดลที่มีความสามารถมากที่สุดจนถึงปัจจุบัน เนื่องจาก Astra เปิดให้ใช้งานอย่างกว้างขวางในช่วงต้นเดือนกันยายน นักพัฒนาบน X ได้เรียกใช้พร้อมท์ที่เหมือนกันกับ Astra ในวันเปิดตัวและเวอร์ชันปัจจุบัน โดยคงการตั้งค่าทุกอย่างไว้เหมือนเดิม และโพสต์การเปรียบเทียบแบบเทียบเคียงกันที่ดูเหมือนจะแสดงโมเดลที่อ่อนแอลงอย่างเงียบๆ หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับโมเดลที่ขับเคลื่อนการอภิปรายนี้ โปรดดูรายงานข่าว การพัฒนา AI ล่าสุด ของเรา

ข้อบกพร่องสามประการที่มีชื่อ

ตามข้อมูลของ Sottiaux ผู้ร้ายรายแรกคือทักษะ ไฟล์พร้อมท์ที่เขียนขึ้นสำหรับโมเดลรุ่นก่อนๆ ซึ่งทำงานบ่อยเกินไปภายใต้ Astra ซึ่งบางครั้งก็หยุดโมเดลไม่ให้ตรวจสอบงานของตัวเอง ประการที่สองคือการทดสอบการจัดการบริบทเสริมที่อาจทำให้โมเดลปิดก่อนเวลาหรือตอบกลับข้อความเก่า OpenAI ปิดใช้งานการทดลองนี้หลังจากผู้ใช้ประมาณ 4,000 ถึง 5,000 รายได้รับผลกระทบ บริษัท กล่าว

ข้อบกพร่องประการที่สามเกี่ยวข้องกับโครงสร้างพื้นฐานมากกว่าตัวโมเดล: เอ็นจิ้นการอนุมานบางตัวได้รับการกำหนดค่าอย่างไม่ถูกต้องและคุณภาพลดลงที่วัดได้บนการรับส่งข้อมูลส่วนท้ายที่ส่งผ่านพวกมัน OpenAI ได้ลบเครื่องยนต์เหล่านั้นออกและทำการซ่อมแซมเล็กๆ น้อยๆ หลายอย่าง Sottiaux เขียนว่าขณะนี้โมเดลติดตามข้อความล่าสุดของผู้ใช้ได้แม่นยำยิ่งขึ้น เป็นการพยักหน้ารับข้อร้องเรียนที่ Astra ตอบคำถามที่ผู้ใช้ย้ายผ่านไปแล้ว

นักพัฒนาได้ก้าวต่อไปแล้ว

ข้อร้องเรียนที่สร้างขึ้นตลอดทั้งสัปดาห์ นักพัฒนา Pranjal Paliwal ซึ่งเคยยกย่อง Astra เมื่อหลายวันก่อน ได้กลับไปอ่านโค้ดที่เขียนให้เขา จากนั้นเรียกผลลัพธ์ว่า regression มากกว่าความคืบหน้า Dax Raad ผู้สร้างเครื่องมือเขียนโค้ด Opencode ได้ย้ายทีมของเขากลับไปใช้ GPT-5.6 Sol รุ่นเก่า หลังจากที่ใช้จ่ายกับ Astra เพิ่มขึ้นสองเท่าเนื่องจากข้อเสียที่เขาคิดว่าไม่คุ้มกับเงินที่จ่ายไป ผู้โพสต์ฟอรัมคนหนึ่งบรรยายว่า Astra อยู่ในระดับเดียวกับ Sol ในงานที่เหมือนกัน และพยายามซ้ำอีกครั้ง

ไม่ใช่ทุกคนที่ยอมรับการอ่านนั้น ผู้ใช้นามแฝงเขียนว่า Antikythera แย้งว่าโมเดลนี้ขี้เกียจและชอบหัวข้อย่อยมาโดยตลอด และผู้ใช้ก็หยุดตื่นตระหนก ความขัดแย้งดังกล่าวแสดงให้เห็นว่าการกล่าวอ้างคุณภาพแบบจำลองนั้นยากเพียงใดในการยุติ: การแจ้งที่เหมือนกัน คำตัดสินที่ต่างกัน

ปัญหาความจุในเบื้องหลัง

แถวคุณภาพมาถึงแล้วในขณะที่กำลังการผลิตยังขัดขวางการเปิดตัว OpenAI ได้ลดขีดจำกัดการใช้งาน Astra สำหรับผู้ใช้ ChatGPT จำนวนมากตามรายงานผู้ใช้ และหยุดการสมัครสมาชิก Pro ใหม่มูลค่า $200 ชั่วคราว ซึ่งเป็นขั้นตอนที่ Sottiaux ยืนยันเมื่อวันที่ 10 กันยายน โดยอ้างถึงความต้องการ โมเดลยังคงมีราคา 10 ดอลลาร์ต่อโทเค็นอินพุต 1 ล้านดอลลาร์ และโทเค็นเอาท์พุต 50 ดอลลาร์ต่อล้าน ซึ่งเป็น 2.5 เท่าของราคาที่ Sol เรียกเก็บเมื่อเปิดตัว

นอกจากนี้ยังมีตัวอย่างที่น่าอึดอัดใจ: นี่เป็นเรือธง OpenAI ตัวที่สองในรอบสองเดือนที่ดึงข้อกล่าวหาเดียวกันจากผู้ใช้ที่จ่ายเงิน ในเดือนกรกฎาคม ผู้ใช้กล่าวว่าโหมดการใช้เหตุผลอันดับต้นๆ ของ Sol ตื้นเขินในชั่วข้ามคืน Sottiaux ปฏิเสธว่าจงใจทำให้มันอ่อนแอลงในขณะนั้น ในขณะเดียวกันก็ยืนยันว่าบริษัทกำลังทดลองโดยใช้ความพยายามในการให้เหตุผล วงจรซ้ำแล้วซ้ำอีกของ "แบบจำลองแย่ลง" ตามด้วย "เราพบข้อบกพร่อง" กำลังกลายเป็นรูปแบบที่บริษัทจะต้องจัดการ ความโปร่งใสช่วยได้ แต่ความเสถียรก็เช่นกัน

คำแนะนำของ OpenAI: ใช้รั้วให้น้อยลง

นอกเหนือจากการแก้ไขแล้ว OpenAI ยังเผยแพร่คำแนะนำในการย้ายจากวิศวกร Eric Provencher ซึ่งถือเป็นคำแนะนำที่ขัดกับสัญชาตญาณ: โมเดลที่มีความสามารถมากกว่านั้นต้องการการจับมือที่น้อยลง คำอธิบายทักษะที่ยาวเกินไป ข้อกำหนดในการอ่านแบบครอบคลุม และกฎการอนุมัติที่เข้มงวดอาจเข้ามาขวางทาง Astra ได้ คำแนะนำกล่าว คำแนะนำที่สะสมอยู่ตลอดเวลาอาจกินบริบทหรือทำให้โมเดลหยุดทำงานเร็วเกินไป

Provencher แนะนำให้ทีมตรวจสอบทักษะ ไฟล์ AGENTS.md และการแจ้งเตือนงานทุกครั้งที่พวกเขาเปลี่ยนโมเดล ผูกคำสั่งไว้กับงานเฉพาะอย่างแน่นหนา และกำหนดอย่างชัดเจนเมื่องานเสร็จสิ้น เพราะแม้จะไม่มีข้อจำกัด Astra ก็อาจหยุดเร็วกว่า GPT-5.6 Sol ได้ ทีมที่ล็อคสิ่งต่าง ๆ หลังจากโมเดลก่อนหน้านี้โกงควรกลับมาทบทวนกฎเหล่านั้นอีกครั้ง: Astra มีวิจารณญาณที่ดีกว่า โพสต์ให้เหตุผล แต่มันสามารถตีความข้อจำกัดเก่า ๆ ได้อย่างแท้จริงจนหยุดเมื่อคุณต้องการให้มันดำเนินต่อไป

จะเกิดอะไรขึ้นต่อไป

การรีเซ็ตการใช้งานช่วยให้สมาชิก Codex มีกระดานชนวนที่ชัดเจนในการประเมินโมเดลอีกครั้ง และ OpenAI จะดูการทดสอบแบบเคียงข้างกันที่ผู้ใช้ดำเนินการ คำถามที่ลึกกว่านั้นคือความไว้วางใจ: นักพัฒนาที่จ่ายเงินซึ่งเห็นว่าเรือธงลดลงภายในหนึ่งสัปดาห์หลังจากเปิดตัว ตอนนี้มีคำอธิบายที่เป็นเอกสาร ข้อบกพร่องที่ระบุชื่อสามรายการ และการรีเซ็ต — แต่ยังเป็นเหตุผลใหม่ในการเปรียบเทียบมาตรฐานการอัปเดตทุกรุ่นเทียบกับวันที่จัดส่ง

ก้าวนำหน้า AI

การเปิดตัวโมเดล การชันสูตรพลิกศพที่มีข้อบกพร่อง และเครื่องมือที่ปรับเปลี่ยนรูปแบบการทำงานของซอฟต์แวร์ — มีการติดตามทุกวัน

อ่านข่าว AI เพิ่มเติม →