ทีมงาน Ornith ได้เปิดตัว Ornith-1.5 ซึ่งเป็นกลุ่มโมเดลภาษาแบบ open-weight ที่สร้างขึ้นจากแนวคิดที่ไม่ธรรมดา: โมเดลนี้สร้างงานการฝึกอบรมของตัวเอง ออกแบบโครงร่างของตัวเอง และเรียนรู้จากความพยายามในการแก้ปัญหาของตัวเองในลูปที่ทำงานอย่างต่อเนื่อง จากการประเมินของทีมเอง Ornith-1.5-397B ซึ่งเป็นรุ่นเรือธงได้คะแนน 86.1 บน Terminal-Bench 2.1 (Terminus-2) ซึ่งทำได้ทัดเทียมกับ Claude Opus 4.8 ของ Anthropic ที่ 85.0 และเหนือกว่ารุ่นโอเพ่นซอร์สอื่นๆ ที่มีขนาดใกล้เคียงกัน
การเปิดตัวซึ่งเผยแพร่ในสัปดาห์นี้ในบล็อก Ornith และบน Hugging Face ภายใต้ใบอนุญาต MIT ถือเป็นการระดมพลครั้งล่าสุดในการแข่งขัน AI แบบโอเพ่นซอร์สซึ่งเคยสร้างผลลัพธ์ที่ครั้งหนึ่งเคยคิดว่าเป็นไปไม่ได้หากไม่มีงบประมาณของห้องปฏิบัติการชายแดน สำหรับนักพัฒนาและองค์กรที่ติดตาม ข่าวโมเดล AI ล่าสุด ความสำคัญมีสองเท่า นั่นคือ ความเท่าเทียมกันของเกณฑ์มาตรฐานกับโมเดลปิดชั้นนำ และสูตรการฝึกอบรมที่ชี้ว่าการพัฒนาโมเดลแบบเปิดกำลังมุ่งหน้าไปยังทิศทางใด
สามขนาดหนึ่งสูตร
Ornith-1.5 จัดส่งในการกำหนดค่าสามแบบ: เรือธงแบบผสมผสานพารามิเตอร์ 397B, MoE 35B ที่เปิดใช้งานเพียงพารามิเตอร์ 3B ต่อโทเค็น และโมเดลหนาแน่น 9B ขนาดกะทัดรัดพร้อมตัวแปร "มือถือ" แบบเชิงปริมาณที่ออกแบบมาเพื่อทำงานโดยตรงบนอุปกรณ์ iPhone และ Android ทั้งสามรุ่นมีให้ใช้งานบน Hugging Face ควบคู่ไปกับรุ่น GGUF, MLX และ NVFP4 และการ์ดรุ่นระบุว่าตระกูลนี้สร้างขึ้นบนสถาปัตยกรรม Qwen3.5 MoE
เชื้อสายมีความสำคัญที่นี่ Ornith-1.0 ซึ่งเปิดตัวเมื่อต้นปีนี้ ทำให้แนวทาง "นั่งร้านด้วยตนเอง" แพร่หลายในการเข้ารหัสแบบเอเจนต์ และกลายเป็นที่นิยมอย่างเงียบ ๆ - โครงสร้าง 9B GGUF ของมันบันทึกการดาวน์โหลดมากกว่าห้าล้านครั้งบน Hugging Face Ornith-1.5 ขยายกรอบการทำงานดังกล่าวจากการเพิ่มประสิทธิภาพโครงร่างและการเปิดตัวไปสู่ขั้นตอนการพัฒนาตนเองอย่างเต็มรูปแบบ
อธิบายห่วงการพัฒนาตนเอง
ในไปป์ไลน์หลังการฝึกอบรมแบบเดิมๆ การเรียนรู้แบบเสริมกำลังดำเนินไปโดยขัดกับชุดงานที่ตายตัวซึ่งดูแลโดยมนุษย์ Ornith-1.5 กลับมีโมเดลเสนองานใหม่ สร้างโครงงานเฉพาะงาน — คำแนะนำ เครื่องมือ และกลยุทธ์การสลายตัวที่ใช้ในการโจมตีปัญหา — จากนั้นสร้างการเปิดตัวโซลูชันที่ได้รับคะแนนจากโครงงานที่เพิ่งสร้างขึ้น รางวัลจะถูกเผยแพร่กลับผ่านทั้งสามขั้นตอนโดยใช้ GRPO ดังนั้นระบบจึงเรียนรู้ที่จะเขียนงานที่ดีขึ้น โครงสร้างที่ดีขึ้น และแนวทางแก้ไขที่ดีขึ้นไปพร้อมๆ กัน
รางวัลในการสร้างงานคือหัวใจของการออกแบบ แต่ละงานที่เสนอจะได้รับคะแนนจากสัญญาณการคูณสามสัญญาณ: ความถูกต้อง (โครงดำเนินการและประเมินอย่างถูกต้องหรือไม่) ความยากระดับแนวหน้า (อัตราความสำเร็จเชิงประจักษ์ของแบบจำลองอยู่ใกล้กับเป้าหมายประมาณ 20 เปอร์เซ็นต์ ทำให้งานท้าทายแต่สามารถเรียนรู้ได้หรือไม่) และความแปลกใหม่ (มันแตกต่างจากทุกสิ่งในบัฟเฟอร์ของงานที่สร้างไว้ก่อนหน้านี้เพียงพอหรือไม่) เนื่องจากความยากวัดจากอัตราความสำเร็จในปัจจุบันของโมเดล หลักสูตรจะเลื่อนระดับโดยอัตโนมัติเมื่อโมเดลปรับปรุง
ทีมงานยังรายงานมาตรการป้องกันการแฮ็กอย่างชัดเจนในระหว่างการประเมิน: ประวัติ git ถูกดึงออกจากอิมเมจที่เก็บข้อมูล ดังนั้นโมเดลจึงไม่สามารถกู้คืนโซลูชันก่อนหน้านี้ได้ และการเข้าถึงเครือข่ายถูกปิดใช้งานเพื่อป้องกันไม่ให้โมเดลดึงคำตอบจากภายนอก ผลลัพธ์ทั้งหมดจะถูกเฉลี่ยจากการวิ่งอิสระห้าครั้ง
ตัวเลข
สำหรับการเข้ารหัสแบบเอเจนต์ กลุ่มผลลัพธ์ที่รายงานด้วยตนเองของเรือธงจะอยู่ที่ด้านบนของช่องโอเพ่นซอร์ส บน Terminal-Bench 2.1 วิ่งผ่านสายรัด Terminus-2, 86.1 ของ Ornith-1.5-397B เหนือกว่า Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) และ GLM-5.2 (81) บนเกณฑ์มาตรฐานเดียวกันที่ทำงานผ่านชุดควบคุม Claude Code นั้น Ornith-1.5 โพสต์ 85.2 เทียบกับ Opus 4.8 ที่ 78.9 บน SWE-bench Verified ทั้งสองเสมอกันอย่างมีประสิทธิภาพที่ 86.0 และ 85.8 โดย Kimi K3 นำหน้าเล็กน้อยที่ 86.2
ช่องว่างขยายกว้างขึ้นในชุดเอเจนต์ที่ยากกว่า บน DeepSWE นั้น Ornith-1.5-397B ได้คะแนน 56.0 ซึ่งเหนือกว่า GLM-5.2 ที่ 46.2 แม้ว่าจะตามหลัง Opus 4.8 (59.0) และ Kimi K3 (67.5) การก้าวกระโดดที่โดดเด่นที่สุดคือรุ่นทั่วไป: Ornith-1.0 ได้คะแนนเพียง 8.0 ใน DeepSWE ซึ่งหมายความว่าการทำซ้ำครั้งใหม่นี้ให้การปรับปรุงเจ็ดเท่าในกลุ่มมาตรฐานเดียวกัน
โมเดลเล็กๆ บอกเล่าเรื่องราวของตัวเอง Ornith-1.5-35B-A3B ซึ่งเปิดใช้งานเพียงพารามิเตอร์ 3B ต่อโทเค็น ได้คะแนน 68.5 บน Terminal-Bench 2.1 (Claude Code) เทียบกับ 43.4 สำหรับ Gemma 4-31B ของ Google และ 51.7 สำหรับ Muse Glimmer-30B ของ Meta และโพสต์ 79.0 บน SWE-bench Verified รุ่น 9B ทำคะแนนได้ถึง 47.0 บน Terminal-Bench 2.1, 70.6 บน SWE-bench Verified และ 86.4 บน GPQA Diamond — ตัวเลขที่ทำให้รุ่นระดับโทรศัพท์อยู่ในระยะที่สามารถเอาชนะคู่แข่งระดับเดสก์ท็อปได้
คำเตือนและบริบท
สิ่งเหล่านี้เป็นเกณฑ์มาตรฐานที่ดำเนินการโดยนักพัฒนา ไม่ใช่ผลการตรวจสอบโดยอิสระ และแบบจำลองการเปรียบเทียบได้รับการประเมินโดยทีมงาน Ornith ภายใต้การตั้งค่าสายรัดของตนเอง ห้องทดลองของคู่แข่งยังปรับแต่งเพื่อการแลกเปลี่ยนที่แตกต่างกัน ความเป็นผู้นำของ Kimi K3 ใน DeepSWE ชี้ให้เห็นว่าขอบเขตของงานซอฟต์แวร์เอเจนต์ยังคงมีข้อโต้แย้ง แต่ความโปร่งใสแบบเต็มตารางของการเปิดตัว - ค่าเฉลี่ยห้ารัน, การกำหนดค่าสายรัดที่เผยแพร่, การป้องกันที่เปิดเผย - ทำให้การผลิตซ้ำอย่างอิสระตรงไปตรงมาอย่างผิดปกติ
การตอบสนองของชุมชนมีความสำคัญมาก การประกาศเปิดตัวมีคะแนนมากกว่าร้อยคะแนนใน Hacker News ภายในไม่กี่ชั่วโมง โดยการสนทนามุ่งเน้นไปที่การอ้างมาตรฐานน้อยกว่าวิธีการปรับปรุงตนเอง ซึ่งผู้แสดงความคิดเห็นหลายคนอธิบายว่าเป็นหนึ่งในการใช้งานแบบเปิดที่น่าเชื่อถือมากขึ้นของการสร้างงานแบบเรียกซ้ำ
สำหรับระบบนิเวศโอเพ่นซอร์ส Ornith-1.5 มาถึงช่วงเวลาที่โมเดลแบบเปิดจากห้องปฏิบัติการของจีนและทีมงานอิสระจากตะวันตกได้ปิดช่องว่างด้วยขอบเขตที่ปิดในด้านการเขียนโค้ดและงานเอเจนต์ กลุ่มผลิตภัณฑ์ที่ได้รับใบอนุญาตจาก MIT ซึ่งตรงกับรุ่นปิดชั้นนำบน Terminal-Bench — และจัดส่งรุ่น 9B ที่พร้อมใช้งานสำหรับโทรศัพท์ — จะช่วยลดช่องว่างนั้นให้แคบลงอีก และดำเนินการด้วยวิธีการฝึกอบรมที่ใครๆ ก็สามารถตรวจสอบ ทำซ้ำ และขยายได้
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →