มาตรฐานใหม่ที่เรียกว่า Real-SWE กำลังท้าทายวิธีที่อุตสาหกรรม AI วัดความสามารถในการเขียนโค้ด และผลลัพธ์แรกก็น่ายินดีสำหรับห้องปฏิบัติการชายแดน Fable 5.1 ของ Anthropic ทำงานภายใต้การควบคุมของ Claude Code เป็นผู้นำบอร์ดด้วยอัตราความละเอียด 38.8% ในงานที่ดึงมาจากโค้ดเบสองค์กรส่วนตัวในโลกแห่งความเป็นจริง ไม่มีการทดสอบแบบจำลองใดที่ชัดเจน 40 เปอร์เซ็นต์

เกณฑ์มาตรฐานที่เผยแพร่ในเดือนนี้โดยเฉพาะ Labs ประเมินโมเดล AI ระดับแนวหน้าบนโค้ดเบสการผลิตส่วนตัวที่ทีมงานได้รับอนุญาตจากบริษัทจริง ผู้สร้างยืนยันว่างานที่ผู้เชี่ยวชาญสร้างขึ้นหรืองานสังเคราะห์ แม้ว่าได้รับการออกแบบมาอย่างดีก็ตาม ไม่ใช่งานคำต่อคำที่วิศวกรในบริษัทจริงทำ For more context on this story, see our ongoing AI industry coverage.

เหตุใด Codebases ส่วนตัวจึงเปลี่ยนรูปภาพ

Real-SWE แตกต่างจากเกณฑ์มาตรฐานที่กำหนดไว้ เช่น SWE-bench บนสองแกน ตามที่ผู้เขียนระบุ: สิ่งประดิษฐ์การเข้ารหัสพื้นฐานและความจำเพาะของคำสั่ง แต่ละงานมาจากระบบที่เป็นกรรมสิทธิ์ซึ่งโค้ดและโซลูชันไม่พร้อมใช้งานบนอินเทอร์เน็ตสาธารณะ ซึ่งหมายความว่าเจ้าหน้าที่ไม่สามารถอาศัยคำตอบที่จดจำซึ่งดึงมาจากที่เก็บข้อมูลสาธารณะได้

งานนี้ยังส่งผลทางธุรกิจอีกด้วย งานตัวอย่างของเกณฑ์มาตรฐาน ได้แก่ การเรียกเก็บเงินที่ถูกต้อง การคำนวณภาษี และการย้ายลูกค้า ซึ่งการเปลี่ยนแปลงที่ส่งผลต่อวิธีการดำเนินธุรกิจ ซึ่งมักจะเกิดขึ้นในบริการต่างๆ ทุกบริษัทมีแบบแผนและวิธีการเขียนโค้ดเป็นของตัวเอง และตัวแทนจะต้องเข้าใจบรรทัดฐานเหล่านั้นและทำการเปลี่ยนแปลงที่ใช้ได้กับสิ่งที่มีอยู่แล้ว

"ตัวแทนการเขียนโค้ดสามารถทำงานของวิศวกรซอฟต์แวร์ในโลกแห่งความเป็นจริงได้จริงหรือ" การแนะนำของเกณฑ์มาตรฐานถาม บอร์ดผู้นำเสนอคำตอบสำหรับตอนนี้คือ: เพียงประมาณหนึ่งในสามของเวลาที่ดีที่สุดเท่านั้น

กระดานผู้นำแบบเต็ม

ห้องปฏิบัติการเฉพาะประเมินการผสมผสานแบบจำลองและสายรัดชายแดนแปดชุด โดยวัดอัตราความละเอียดโดยที่ pass@1 โดยเฉลี่ยมากกว่าแปดการทำงานอิสระต่องาน โดยมีช่วงความเชื่อมั่น 95 เปอร์เซ็นต์:

1. นิทาน 5.1 (รหัสโคลด) — 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. Gemini 3.8 แฟลช (Gemini CLI) — 31.2%
4. GLM 5.3 (รหัสโคลด) — 28.8%
5. (เสมอ) Grok 4.6 (Grok Build) — 23.8%
5. (เสมอ) Muse Spark 1.3 (รหัส Muse) — 23.8%
7. Kimi K3 (รหัส Kimi) — 18.8%
8. GPT-5.6 โซล (Codex CLI) — 16.2%

ผลลัพธ์ได้รับการพูดคุยกันอย่างกว้างขวางใน Hacker News ในช่วงสุดสัปดาห์ ซึ่งเกณฑ์มาตรฐานดึงดูดผู้โหวตหลายร้อยคน และมีการถกเถียงกันอย่างมีชีวิตชีวาว่าการประเมินโค้ดเบสส่วนตัวเป็นมาตรฐานที่เหมาะสมสำหรับความก้าวหน้าของตัวแทนหรือไม่

การแพร่กระจายที่แคบ แต่มีความหมายที่ด้านบน

ช่องว่างระหว่างระบบสี่อันดับแรกนั้นมีความโดดเด่นจากสิ่งที่กล่าวเกี่ยวกับแนวการแข่งขันในปัจจุบัน ความเป็นผู้นำห้าแต้มของ Fable 5.1 เหนือ GPT-6 Astra ของ OpenAI นั้นมีความหมายในการวัดประสิทธิภาพ โดยที่ทุกงานเป็นปัญหาในการผลิตจริง Gemini 3.8 Flash คว้าอันดับที่ 3 ได้อย่างน่าทึ่ง เนื่องจากโมเดลดังกล่าวอยู่ในตำแหน่งที่ทำงานได้รวดเร็วและมีต้นทุนต่ำ มากกว่าที่จะเป็นระบบการให้เหตุผลหลัก GLM 5.3 ของ Z.ai ได้รับการประเมินผ่าน Claude Code ซึ่งเชื่อมโยงไปถึงภายในห้าคะแนนของผู้นำ เป็นการตอกย้ำว่าโมเดล open-weight ที่มีการแข่งขันสูงกลายเป็นงานวิศวกรรมเชิงปฏิบัติได้อย่างไร

การบอกอย่างเท่าเทียมกันคือการแพร่กระจายที่ด้านล่าง GPT-5.6 Sol ซึ่งเป็น OpenAI รุ่นก่อนหน้า สามารถแก้ไขงานได้น้อยกว่าครึ่งหนึ่งของ Fable 5.1 ซึ่งเป็นเครื่องเตือนใจว่าชายแดนได้เคลื่อนตัวไปเร็วแค่ไหน และการลดระดับลงนั้นสามารถเป็นเพียงแบบจำลองเดียวที่ย้อนกลับไปได้มากเพียงใด

สายรัดมีความสำคัญพอๆ กับโมเดล

หนึ่งในตัวเลือกด้านระเบียบวิธีของการวัดประสิทธิภาพคือการดึงดูดความสนใจ: แทนที่จะประเมินแบบจำลองแบบแยกส่วน Real-SWE ใช้สายรัดแบบเนทิฟ — Claude Code, Codex CLI, Gemini CLI, Grok Build — เพื่อสะท้อนถึงวิธีการทำงานของวิศวกรระดับองค์กรในทางปฏิบัติ บอร์ดผู้นำจะจัดอันดับการรวมกันของโมเดลและชุดสายรัดอย่างชัดเจน โดยยอมรับว่าขณะนี้การนั่งร้าน การเข้าถึงเครื่องมือ และลูปการวนซ้ำนั้นแยกออกจากความสามารถของโมเดลในการปรับใช้จริงได้

การกำหนดกรอบดังกล่าวมีความสำคัญสำหรับองค์กรในการเลือกระบบ รุ่นเดียวกันสามารถทำงานได้แตกต่างกันมากขึ้นอยู่กับสายรัดของตัวแทนที่พันอยู่ และผู้ซื้อที่ประเมินผู้ช่วยเขียนโค้ดด้วยตัวเลขมาตรฐานสาธารณะอาจได้รับภาพที่บิดเบี้ยวว่าระบบเหล่านั้นจะทำงานอย่างไรบนโค้ดเบสของตนเอง

มันหมายถึงอะไรสำหรับอุตสาหกรรม

เกณฑ์มาตรฐานถูกกล่าวหาซ้ำแล้วซ้ำอีกว่าอิ่มตัว โดยแบบจำลองระดับแนวหน้าโพสต์คะแนนที่เกือบสมบูรณ์แบบในการทดสอบสาธารณะที่รั่วไหลไปสู่ข้อมูลการฝึกอบรม การออกแบบของ Real-SWE พยายามตอบโต้ทั้งสองปัญหาในคราวเดียว: รหัสเป็นแบบส่วนตัวและได้รับใบอนุญาต งานเป็นผลงานของแท้ของทีมวิศวกรที่ทำงาน และคำแนะนำสะท้อนให้เห็นถึงความเฉพาะเจาะจงที่ยุ่งเหยิงของตั๋วจริงมากกว่าการแจ้งปัญหาที่ขัดเกลา

Takeaway ที่ทำให้มีสติเป็นระดับที่แน่นอน แม้แต่ระบบที่ดีที่สุดก็สามารถแก้ไขงานขององค์กรจริงได้น้อยกว่าสี่ในสิบในความพยายามครั้งแรก โดยเฉลี่ยมากกว่าแปดงาน สำหรับความคืบหน้าทั้งหมดในการเข้ารหัสแบบเอเจนต์ เกณฑ์มาตรฐานชี้ให้เห็นว่าวิศวกรรมซอฟต์แวร์อัตโนมัติบนระบบการผลิตจริงยังคงเป็นกิจกรรมที่ได้รับการดูแล - กิจกรรมที่วิศวกรที่เป็นมนุษย์ตรวจสอบ เปลี่ยนเส้นทาง และซ่อมแซมบ่อยกว่าการสาธิตของผู้จำหน่าย

สำหรับองค์กรที่เลือกใช้ผู้ช่วยเขียนโค้ด เกณฑ์มาตรฐานจะเสนอรายการตรวจสอบที่ใช้งานได้จริง: ชอบระบบที่ประเมินด้วยโค้ดส่วนตัว ยืนยันช่วงความเชื่อมั่นมากกว่าตัวเลขพาดหัวแบบเรียกใช้ครั้งเดียว และคุณภาพของชุดควบคุมน้ำหนักมากพอๆ กับความสามารถของโมเดลดิบ บอร์ดผู้นำแรกของ Real-SWE จะไม่ใช่คำตอบสุดท้าย — แต่เป็นคำตอบที่ตรงที่สุดสำหรับคำถามที่ผู้นำด้านวิศวกรรมทุกคนถามเกี่ยวกับการเข้ารหัสแบบเอเจนต์

หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับตัวแทนการเขียนโค้ด การเผยแพร่โมเดล และการวิจัยที่กำหนดรูปแบบ โปรดติดตามข่าว AI ล่าสุดเมื่อผลการวัดประสิทธิภาพรอบถัดไปมาถึง

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →