Fireworks Research ซึ่งเป็นทีมโมเดลในสตาร์ทอัพการอนุมาน Fireworks AI ได้เปิดตัว Ember-1 โมเดลพิเศษที่บริษัทกล่าวว่าให้คำตอบเดียวกันกับ Kimi K3 ของ Moonshot AI ในขณะที่ปล่อยโทเค็นน้อยลงประมาณ 40% โมเดลดังกล่าวเผยแพร่บนแพลตฟอร์มของ Fireworks เมื่อวันที่ 23 กันยายน และในช่วงไม่กี่วันที่ผ่านมา โมเดลดังกล่าวได้กลายเป็นหนึ่งในรุ่นที่ได้รับการกล่าวถึงมากที่สุดในชุมชนนักพัฒนา โดยได้รับคะแนนโหวตหลายร้อยรายการใน Hacker News ในขณะที่ผู้เขียนโค้ดถกเถียงกันว่าโทเค็นการให้เหตุผลเป็นขอบเขตต้นทุนถัดไปหรือไม่

การเสนอขายเกิดขึ้นในช่วงเวลาที่ใบเรียกเก็บเงินการอนุมาน ไม่ใช่ความสามารถของแบบจำลอง เป็นตัวตัดสินมากขึ้นว่าทีมใดจะสามารถจัดส่งได้ สำหรับทีมที่ดูปริมาณงานแบบ Agent ต้องใช้งบประมาณ การพัฒนา AI ล่าสุด แสดงให้เห็นสิ่งหนึ่งที่ชัดเจน: พฤติกรรมที่แพงที่สุดในอุตสาหกรรมในขณะนี้ไม่ใช่การฝึกโมเดลระดับแนวหน้า แต่กำลังดำเนินการอยู่ Ember-1 เป็นความพยายามของ Fireworks ในการโจมตีปัญหาดังกล่าวโดยตรง และบริษัทได้สนับสนุนปัญหาดังกล่าวด้วยชุดเกณฑ์มาตรฐานและหมายเลขการผลิตที่มีรายละเอียดผิดปกติ

การคิดแบบอย่างคิดมากเกินไป

ข้อสังเกตหลักที่อยู่เบื้องหลัง Ember-1 คือโมเดลการให้เหตุผลอย่าง Kimi K3 ใช้โทเค็นที่สร้างขึ้นส่วนใหญ่ ซึ่งบางครั้งมากกว่า 90% ตามข้อมูลของ Fireworks ในการใช้เหตุผลภายในมากกว่าที่จะตอบคำถามเอง ตามคำขอเดียวนั่นมีราคาแพง ในปริมาณงานแบบเอเจนต์ จะมีการทบต้น: ทุกเทิร์นของการสนทนาของตัวแทนจะเล่นซ้ำการให้เหตุผลก่อนหน้าทั้งหมดกลับไปยังโมเดล ดังนั้นบริบทจึงขยายเป็นกำลังสองโดยประมาณตามจำนวนรอบ และการติดตามการให้เหตุผลแบบยาวตั้งแต่เทิร์นแรกจะถูกอ่านซ้ำและเรียกเก็บเงินซ้ำทุกครั้งที่มีการโทรครั้งต่อๆ ไป

Fireworks กล่าวว่าลูกค้าบอกพวกเขาว่าพวกเขาต้องการความสามารถในการเขียนโค้ดของ Kimi K3 ด้วยต้นทุนที่ต่ำกว่า แต่การปฏิเสธความพยายามในการให้เหตุผลของโมเดลนั้นไม่ได้ผล การตั้งค่าที่ใช้ความพยายามต่ำทำให้คุณภาพมากเกินไป ทางเลือกอื่นคือการฝึกแบบจำลองที่ให้เหตุผลอย่างมีประสิทธิภาพมากขึ้น ในขณะเดียวกันก็รักษาเหตุผลที่สำคัญไว้ด้วย

ฝึกอบรมการกำจัดของเสีย

Building Ember-1 ได้ทำการทดลองฝึกอบรมมากกว่า 50 ครั้งและการประเมินมากกว่า 200 ครั้ง โดยดำเนินการทั้งหมดบนแพลตฟอร์ม Serverless Training ของ Fireworks อ้างอิงจากบล็อกโพสต์ของบริษัท ทีมงานกล่าวว่าได้พัฒนาอัลกอริธึมการฝึกอบรมใหม่เพื่อลดการใช้เหตุผลโดยไม่สูญเสียความแม่นยำ

โดยเฉพาะอย่างยิ่ง บริษัทไม่ได้พยายามที่จะยกเลิกการขายส่งเหตุผล การใช้คำฟุ่มเฟือยที่ชัดเจนบางประการของ Kimi K3 คือการไตร่ตรองตนเองอย่างมีประสิทธิผล การทบทวนสมมติฐาน การตอบสนองต่อข้อเสนอแนะ หรือการติดตามผลลัพธ์กลับไปยังการตัดสินใจก่อนหน้านี้ ช่วยให้แบบจำลองฟื้นตัวจากข้อผิดพลาด ระบอบการฝึกอบรมได้รับการออกแบบมาเพื่อรักษาความสามารถนั้นไว้ในขณะที่ตัดลูปที่ไม่เกิดผลออก

ข้อมูลการฝึกอบรมครอบคลุมทั้งคณิตศาสตร์ การเขียนโค้ด การปฏิบัติตามคำสั่ง การสนทนา การค้นหา การใช้เครื่องมือ และวิศวกรรมซอฟต์แวร์ ครอบคลุมทั้งปัญหาแบบสแตนด์อโลนและการโต้ตอบหลายรอบที่ขยายออกไป Fireworks กล่าวว่าใช้เฉพาะข้อมูลของตัวเองเท่านั้น และไม่มีข้อมูลลูกค้า

เกณฑ์มาตรฐาน: บนหรือใกล้ชายแดน Pareto

ในกรณีของต้นทุน Fireworks จะคำนวณต้นทุนต่อเกณฑ์มาตรฐานโดยใช้การกำหนดราคา API สาธารณะของ Kimi K3 — 3 ดอลลาร์ต่อโทเค็นอินพุตที่ไม่แคช 0.30 ดอลลาร์ต่อล้านโทเค็นอินพุตที่แคชไว้ และ 15 ดอลลาร์ต่อล้านโทเค็นเอาท์พุต และเปรียบเทียบ Ember-1 กับ K3 โดยใช้ความพยายามในการให้เหตุผลในระดับต่ำ สูง และสูงสุด ในทุกเกณฑ์มาตรฐานที่มีตัวอย่างทดสอบมากกว่า 50 ตัวอย่าง บริษัทรายงานว่า Ember-1 ตั้งอยู่บนหรือใกล้ชายแดน Pareto โดยจับคู่ K3 ด้วยความพยายามสูงสุดด้วยต้นทุนเพียงเล็กน้อย และครอบงำ K3 อย่างเคร่งครัดด้วยความพยายามต่ำ

การเปรียบเทียบพาดหัวกับ K3 ด้วยความพยายามสูงสุด ตามที่รายงานโดย Fireworks:

| เกณฑ์มาตรฐาน | ตัวอย่าง | K3 (ความพยายามสูงสุด) | เอ็มเบอร์-1 |
|---|---|---|---|
| เทอร์มินัลม้านั่ง 2.1 | 89 | 80.9% | 82.0% |
| SWE-bench ยืนยันแล้ว | 500 | 93.2% | 92.2% |
| SWE-โต้ตอบ | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-Bench Airlines | 50 | 64% | 66% |

ในด้านต้นทุนต่องาน Fireworks รายงานว่า Ember-1 ลดการใช้จ่ายลง 51.9% ใน Terminal Bench 2.1, 32.5% ใน SWE-Interact, 23.7% ใน DeepSWE 1.1 และ 15.5% ใน SWE-bench Verified เมื่อเทียบกับ K3 ที่ความพยายามสูงสุด ในกรณีของ DeepSWE ส่วนต่างมากกว่า 126 ดอลลาร์ต่อหน่วยของงาน ตามอัตราที่คำนวณของบริษัท

บริษัทยังได้ประเมิน Ember-1 บน Bedside Bench ของ Doximity ซึ่งเป็นเกณฑ์มาตรฐานที่แพทย์รับรองสำหรับกรณีทางคลินิก 500 กรณีใน 10 สาขาวิชาเฉพาะทางที่ Fireworks ดำเนินการผ่านดัชนี Specialized Intelligence Index ที่เพิ่งเปิดตัวใหม่ ที่นั่น Fireworks กล่าวว่า Ember-1 กำหนดขอบเขต Pareto ใหม่ในด้านต้นทุนต่องานสำหรับทั้งรุ่นเปิดและปิด รวมถึง GPT-5.6 Sol, GPT-6 Astra และ Claude Opus 5 การกล่าวอ้างดังกล่าวมาจากดัชนีของ Fireworks เองและยังไม่ได้รับการตรวจสอบโดยอิสระ

การเข้าชมสด: โทเค็นน้อยลง คะแนนเท่าเดิม

เกณฑ์มาตรฐานเป็นสิ่งหนึ่ง การผลิตก็เป็นอีกเรื่องหนึ่ง Fireworks ทำการทดสอบ A/B แบบสดกับลูกค้าสองรายเกี่ยวกับปริมาณงานการเขียนโค้ดการผลิต และรายงานว่า Ember-1 ใช้โทเค็นน้อยลงประมาณ 35% ต่องานด้วยคุณภาพที่เทียบเคียงได้ ในการเปรียบเทียบที่วัดได้ครั้งหนึ่ง Kimi K3 ได้คะแนน 0.751 ในขณะที่สร้างโทเค็นเอาต์พุต 49,300 รายการต่องาน เทียบกับ 0.753 สำหรับ Ember-1 ด้วยโทเค็น 29,900 รายการ — โทเค็นการให้เหตุผลลดลง 71.3% และโทเค็นทั้งหมดน้อยลง 39% หลังจากการทดสอบ ลูกค้ารายหนึ่งได้ย้าย Ember-1 ไปสู่การใช้งานจริงโดยมีแผนที่จะขยายขนาดเพื่อแทนที่โมเดลพื้นฐานทั้งหมด

ภายใน Fireworks โมเดลดังกล่าวได้รับการสลับอย่างเงียบๆ เข้ากับขั้นตอนการเขียนโค้ดของบริษัทก่อนเปิดตัว ผลลัพธ์ที่ทีมบอกว่าภูมิใจที่สุด: ไม่มีใครสังเกตเห็น นักพัฒนาทำงานต่อไปโดยตรวจไม่พบสวิตช์ในขณะที่ใช้โทเค็นน้อยลงอย่างมาก

หน่วยสืบราชการลับเฉพาะทางเป็นกลยุทธ์

Ember-1 เป็นโมเดลแรกในซีรีส์ที่วางแผนไว้จาก Fireworks Research และมาพร้อมกับ Specialized Intelligence Index ของบริษัท ซึ่งเป็นความพยายามในการเปรียบเทียบที่เปิดตัวเมื่อต้นเดือนนี้ เพื่อเปรียบเทียบโมเดลแบบเปิด แบบปิด และแบบพิเศษกับงานในโลกแห่งความเป็นจริงที่ผู้เชี่ยวชาญสร้างขึ้น

การเล่นเชิงกลยุทธ์นั้นอ่านง่าย แทนที่จะฝึกโมเดลชายแดนตั้งแต่เริ่มต้น Fireworks ใช้โมเดลแบบ open-weight ที่แข็งแกร่ง ฝึกฝนประสิทธิภาพของโทเค็น และตอนนี้ขายความสามารถแบบเดียวกันด้วยต้นทุนต่องานที่ต่ำกว่า เนื่องจากการเปิดตัวแบบ open-weight จากแล็บอย่าง Moonshot มักจะปิดช่องว่างด้านความสามารถ ผู้ให้บริการการอนุมานจึงค้นพบว่าความแตกต่างที่ยั่งยืนอาจอยู่ที่ต้นทุนต่องานที่เสร็จสมบูรณ์ แทนที่จะเป็นตำแหน่งกระดานผู้นำ ซึ่งเป็นการเปลี่ยนแปลงที่เอื้ออำนวยต่อบริษัทที่มีการฝึกอบรมที่แข็งแกร่งและโครงสร้างพื้นฐานการให้บริการ

คำเตือนควรระบุไว้อย่างชัดเจน: ตัวเลขข้างต้นมาจากบล็อกของ Fireworks การประเมินของบริษัทเอง และลูกค้าที่ชำระเงินของ Fireworks เอง การจำลองแบบอย่างอิสระของการประหยัดโทเค็นบนปริมาณงานภายนอกจะเป็นการทดสอบจริง แต่หากผลลัพธ์ยังคงอยู่ วิธีที่คุ้มค่าที่สุดในการรันโมเดลแบบเปิดระดับแนวหน้าอาจไม่ใช่การทำให้คิดน้อยลงอีกต่อไป แต่อาจเป็นการรันโมเดลที่เรียนรู้ที่จะคิดอย่างมีประสิทธิภาพ
---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →