Cognition บริษัทเบื้องหลังวิศวกรซอฟต์แวร์ Devin AI ได้เปิดตัว SWE-2 เมื่อวันพฤหัสบดี โดยอธิบายว่าเป็นโมเดลการเข้ารหัสที่ทันสมัยที่สุด ในบล็อกโพสต์ที่เผยแพร่เมื่อวันที่ 10 กันยายน บริษัทกล่าวว่าโมเดลใหม่ผลักดันสิ่งที่เรียกว่าขอบเขตความสามารถและราคาของ Pareto โดยได้คะแนน 50.0% บนเกณฑ์มาตรฐาน FrontierCode 1.1 Main ขณะที่มีราคาต่ำกว่า Fable 5.1 ถึง 64% ซึ่งเป็นโมเดล Anthropic ที่นำหน้าเพียงจุดเดียวที่ 50.9%
การเปิดตัวเกิดขึ้นเพียงวันเดียวหลังจากที่ Cognition ยืนยันการระดมทุน 2 พันล้านดอลลาร์ที่การประเมินมูลค่า 48 พันล้านดอลลาร์ และเป็นการส่งสัญญาณว่าการเริ่มต้นการเข้ารหัสแบบเอเจนต์กำลังลงทุนในการพัฒนาแบบจำลองของตัวเองอย่างจริงจังมากกว่าการพึ่งพาโมเดลชายแดนของบุคคลที่สามเพียงอย่างเดียว หากต้องการรายงานข่าวอย่างต่อเนื่องเกี่ยวกับการแข่งขันการเขียนโค้ดของ AI และทุกสิ่งที่ขับเคลื่อนอุตสาหกรรม โปรดบุ๊กมาร์ก AI Buzz Wire ซึ่งเป็นแหล่งข้อมูลข่าวด่วน AI รายวันของคุณ
โดยที่ SWE-2 ขึ้นสู่เกณฑ์มาตรฐาน
จากผลการเผยแพร่ของ Cognition พบว่า SWE-2 โพสต์ 50.0% ใน FrontierCode 1.1 Main นำหน้า Grok 4.6 ที่ 48.0% และ GPT-5.6 Sol ที่ 47.5% และอยู่ในระยะการโจมตีของ GPT-6 Astra ซึ่งเป็นผู้นำในสนามที่ 53.3% ในเกณฑ์มาตรฐาน DeepSWE 1.1 นั้น SWE-2 สูงถึง 73.0% เป็นอันดับสองรองจาก Astra ที่ 74.1% ในรายการความรู้ความเข้าใจของรุ่นต่างๆ
การแสดงที่แข็งแกร่งที่สุดมาจาก Terminal-Bench 2.1 โดยที่ SWE-2 ได้คะแนน 92.8% ซึ่งเป็นตัวเลขที่สูงที่สุดในตารางเปรียบเทียบของ Cognition และแซงหน้า Fable 5.1 ที่ 91.4% และ GPT-6 Astra ที่ 89.9% รูปภาพเปลี่ยนไปใน Terminal-Bench 4 ที่ยากกว่า โดยที่ SWE-2 จัดการ 27.3% เทียบกับ 57.9% สำหรับ GPT-6 Astra และ 55.8% สำหรับ Fable 5.1 ซึ่งเป็นเครื่องเตือนใจว่าการออกแบบที่เน้นประสิทธิภาพของโมเดลเป็นหลักทำให้เหลือช่องว่างที่ด้านบนสุดของความยากของงาน
Cognition สรุปตำแหน่งอย่างตรงไปตรงมา: บน FrontierCode 1.1 Main และ DeepSWE 1.1 นั้น SWE-2 เหนือกว่ารุ่นก่อนหน้า SWE-1.7 และ Grok 4.6 ทั้งในด้านคะแนนและราคา จับคู่ GPT-5.6 Sol และ Fable 5/5.1 ในราคาเพียงเล็กน้อย และอยู่ห่างจาก GPT-6 Astra เพียงไม่กี่จุดในราคาเพียงหนึ่งในสี่
หลังการฝึกอบรมจาก Kimi K3 ในระดับหลายล้านล้าน
SWE-2 ไม่ได้ถูกสร้างขึ้นตั้งแต่เริ่มต้น ความรู้ความเข้าใจหลังการฝึกอบรมโมเดลจาก Kimi K3 ซึ่งเป็นโมเดลพื้นฐาน 2.8 ล้านล้านพารามิเตอร์จาก Moonshot AI ที่ได้รับการเรียนรู้เสริมกำลังอย่างกว้างขวางสำหรับการเข้ารหัสเอเจนติกแล้ว นอกเหนือจากรากฐานดังกล่าว Cognition ยังกล่าวว่ากระบวนการ RL ของบริษัทได้เพิ่มคะแนนอีก 5 ถึง 6 คะแนนจากเกณฑ์มาตรฐานต่างๆ และได้เปลี่ยนขอบเขตด้านประสิทธิภาพด้านต้นทุนทั้งหมดของ K3
บริษัทกล่าวว่า SWE-2 เป็นครั้งแรกที่ได้ขยายขนาดการเรียนรู้แบบเสริมกำลังไปสู่ระบบการปกครองหลายล้านล้านพารามิเตอร์ โดยต่อยอดจากโครงสร้างพื้นฐานการฝึกอบรมและสูตรที่พัฒนาขึ้นสำหรับ SWE-1.7 การเพิ่มที่สำคัญคืออัลกอริธึม RL ที่ฝึกระดับความพยายามในการให้เหตุผลทั้งหมดในรอบเดียว แทนที่จะถือว่าความพยายามระดับต่ำ ปานกลาง และสูงเป็นเป้าหมายการฝึกอบรมที่แยกจากกัน
บทลงโทษด้านต้นทุนกำหนดขอบเขตทั้งหมด
แนวคิดหลักในการฝึกอบรมของ SWE-2 คือการลงโทษต้นทุนเชิงเส้นที่ใช้ต่อระดับความพยายามภายในการวิ่ง RL ครั้งเดียว โดยแต่ละบทลงโทษจะปรับตามความลาดชันในพื้นที่ของชายแดน Pareto ของโมเดลพื้นฐาน Cognition กล่าวว่าแนวทางนี้ ซึ่งได้มาจากหลักการแรกๆ จะพัฒนาขอบเขตด้านต้นทุน-ประสิทธิภาพทั้งหมดของโมเดล ในขณะที่ยังคงรักษารูปทรงและสะท้อนต้นทุนของผู้ใช้จริงโดยตรงที่สุดในการฝึกอบรม
บริษัทยังได้ให้รายละเอียดเกี่ยวกับเส้นฐานรางวัลแบบถ่วงน้ำหนักแบบยาวที่ใช้ตั้งแต่ SWE-1.6 ซึ่งให้เครดิตกับการฝึกอบรมที่มีความเสถียรอย่างมาก ควบคู่ไปกับการปรับปรุงการให้บริการการเปิดตัว RL ซึ่งรวมถึงแบบจำลองแบบร่างออนไลน์เพื่อเพิ่มปริมาณการถอดรหัส ด้วยเคอร์เนล NVFP4 และ FP8 และการฝึกอบรมการรับรู้เชิงปริมาณ Cognition กล่าวว่าจะลดการใช้หน่วยความจำโดยรวม แม้ว่ารุ่นพื้นฐานจะมีพารามิเตอร์มากกว่ารุ่นก่อนเกือบสามเท่าก็ตาม
ไปป์ไลน์ข้อมูลการฝึกอบรมขยายออกไปเช่นกัน: Cognition เพิ่มจำนวนสภาพแวดล้อม RL เป็นสามเท่า เพิ่มการซ้อนทับตามคำสั่ง และสร้างมู่เล่ที่ขับเคลื่อนโดยจุดตรวจสอบ SWE-2 ก่อนหน้านี้ ซึ่งจะทำให้ตัวตรวจสอบที่ใช้ในการให้คะแนนโมเดลแข็งแกร่งขึ้นซ้ำแล้วซ้ำอีก
ประสิทธิภาพพอๆ กับความฉลาด
ความรู้ความเข้าใจกำหนดขอบเขตที่เพิ่มขึ้นของ SWE-2 โดยมีความเชื่อมโยงอย่างใกล้ชิดกับประสิทธิภาพ บริษัทกล่าวว่าวิจารณญาณทางวิศวกรรมที่แข็งแกร่งยิ่งขึ้น ช่วยให้ตัวแทนสามารถเขียนโซลูชันที่สมบูรณ์ยิ่งขึ้น โดยอ้อมน้อยลงและอ่านซ้ำซ้อน บน FrontierCode 1.1 Main การกำหนดค่าความพยายามปานกลางของ SWE-2 มีคะแนนสูงกว่า SWE-1.7 ในขณะที่ใช้เวลาเลี้ยวน้อยลง 58% และต้นทุนน้อยลง 81%
การวางกรอบนั้นมีความสำคัญต่อธุรกิจของ Cognition Devin ขายในฐานะวิศวกรซอฟต์แวร์อิสระ และต้นทุนการอนุมานเป็นข้อมูลป้อนเข้าโดยตรงต่อราคาและส่วนต่างกำไร โมเดลที่มีคุณภาพใกล้เคียงกันในขณะที่ตัดรอบและโทเค็นต่องานจะเปลี่ยนเศรษฐศาสตร์ของทุกเซสชั่น Devin ที่บริษัทให้บริการ
ว่าง
SWE-2 พร้อมใช้งานตั้งแต่วันนี้ใน Devin Desktop และ Devin CLI โดยมีการเปิดตัวบน Devin Web และ Fusion ตามข้อมูลของบริษัท Cognition กล่าวว่าผู้ใช้ควรเห็นโมเดลนี้ปรากฏบนพื้นผิวต่างๆ ในอีกไม่กี่วันข้างหน้า
ความหมายสำหรับตลาดโมเดลการเข้ารหัส
การเปิดตัวครั้งนี้ทำให้กลุ่มที่อยู่เบื้องหลัง GPT-6 Astra มีผู้คนหนาแน่นอยู่แล้ว ขณะนี้ Cognition เป็นเจ้าของโมเดลที่แลกกับข้อเสนอจาก Anthropic, OpenAI และ xAI ในราคาที่ต่ำกว่าอย่างเห็นได้ชัด และควบคุมสแต็กทั้งหมดจากโมเดลไปจนถึงผลิตภัณฑ์ตัวแทน คู่แข่งจะเผชิญกับแรงกดดันในการตอบสนองด้านราคาพอๆ กับความสามารถ โดยเฉพาะอย่างยิ่งสำหรับงานที่มีปริมาณมากและมีความยากปานกลางซึ่งโปรไฟล์ต้นทุนของ SWE-2 นั้นแข็งแกร่งที่สุด
สำหรับผู้ซื้อเครื่องมือเขียนโค้ด AI สิ่งที่นำไปใช้ได้จริงก็คือความช่วยเหลือในการเขียนโค้ดระดับชายแดนไม่จำเป็นต้องมีการกำหนดราคาในระดับชายแดนอีกต่อไป สำหรับส่วนที่เหลือของอุตสาหกรรม SWE-2 เป็นหลักฐานว่าประสิทธิภาพหลังการฝึกอบรมและโครงสร้างพื้นฐาน ไม่ใช่แค่ขนาดแบบจำลองพื้นฐาน ได้กลายเป็นปัจจัยสำคัญในการแข่งขัน
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →