قدمت شركة Fireworks Research، الفريق النموذجي داخل شركة Fireworks AI الناشئة للاستدلال، Ember-1، وهو نموذج متخصص تقول الشركة إنه ينتج نفس الإجابات مثل Kimi K3 من Moonshot AI بينما ينبعث منه رموزًا أقل بنسبة 40٪ تقريبًا. تم إطلاق النموذج على منصة Fireworks في 23 سبتمبر، وعلى مدى الأيام القليلة الماضية أصبح أحد الإصدارات الأكثر مناقشة في مجتمع المطورين، حيث اجتذب مئات الأصوات المؤيدة على Hacker News حيث ناقش المبرمجون ما إذا كانت الرموز المميزة هي حدود التكلفة التالية.

يأتي العرض في وقت تحدد فيه فواتير الاستدلال، وليس القدرة النموذجية، بشكل متزايد ما يمكن للفرق تحمل تكاليفه. بالنسبة للفرق التي تراقب أعباء عمل الوكلاء تستهلك الميزانيات، فقد أوضحت [أحدث تطورات الذكاء الاصطناعي] (https://aibuzzwire.news) أمرًا واحدًا: إن العادة الأكثر تكلفة في الصناعة الآن ليست تدريب النماذج الرائدة، بل تشغيلها. Ember-1 هي محاولة شركة Fireworks لمهاجمة هذه المشكلة بشكل مباشر، وقد دعمتها الشركة بمجموعة مفصلة بشكل غير عادي من المعايير وأرقام الإنتاج.

نماذج التفكير تفكر كثيرًا

الملاحظة الأساسية وراء Ember-1 هي أن نماذج الاستدلال مثل Kimi K3 تنفق غالبية الرموز المميزة التي تم إنشاؤها - أحيانًا أكثر من 90٪، وفقًا لشركة Fireworks - على الاستدلال الداخلي بدلاً من الإجابة نفسها. بناء على طلب واحد، وهذا مكلف. في أعباء عمل الوكيل، فإنه يتضاعف: كل منعطف في محادثة الوكيل يعيد تشغيل كل المنطق السابق مرة أخرى إلى النموذج، لذلك ينمو السياق بشكل تربيعي تقريبًا مع عدد الدورات، وتتم إعادة قراءة آثار الاستدلال الطويلة من المنعطفات المبكرة وإعادة إصدار فواتيرها في كل مكالمة لاحقة.

تقول Fireworks إن العملاء أخبروهم أنهم يريدون قدرة Kimi K3 على البرمجة بتكلفة أقل، ولكن ببساطة رفض جهد التفكير في النموذج لم ينجح - حيث أدت الإعدادات منخفضة الجهد إلى فقدان الكثير من الجودة. وكان البديل هو تدريب نموذج يفكر بطريقة أكثر كفاءة مع الحفاظ على المنطق الذي يهم.

تدريب النفايات

استغرق بناء Ember-1 أكثر من 50 تجربة تدريبية وأكثر من 200 تقييم، وتم إجراؤه بالكامل على منصة التدريب بدون خادم الخاصة بشركة Fireworks، وفقًا لمنشور مدونة الشركة. ويقول الفريق إنه طور خوارزميات تدريب جديدة على طول الطريق لتقصير التفكير دون فقدان الدقة.

والجدير بالذكر أن الشركة لم تحاول التخلص من المنطق بالجملة. إن بعض إسهاب Kimi K3 الواضح هو تأمل ذاتي مثمر - إعادة النظر في الافتراض، أو الاستجابة للتعليقات، أو تتبع النتيجة إلى قرار سابق يساعد النموذج على التعافي من الأخطاء. تم تصميم نظام التدريب للحفاظ على تلك القدرة مع تقليص الحلقات غير المنتجة.

امتدت بيانات التدريب إلى الرياضيات، والبرمجة، ومتابعة التعليمات، والمحادثة، والبحث، واستخدام الأدوات، وهندسة البرمجيات، وتغطي كلاً من المشكلات المستقلة والتفاعلات الممتدة متعددة المنعطفات. تقول شركة Fireworks إنها استخدمت بياناتها الخاصة فقط ولم تستخدم بيانات العملاء.

المعايير: على حدود باريتو أو بالقرب منها

ولتوضيح حالة التكلفة، قامت Fireworks بحساب التكلفة المعيارية باستخدام تسعير واجهة برمجة التطبيقات العامة لـ Kimi K3 - 3 دولارات لكل مليون رمز إدخال غير مخبأ، و0.30 دولار لكل مليون رمز إدخال مخبأ، و15 دولارًا لكل مليون رمز مميز للمخرج - وقارنت Ember-1 مع K3 بجهد تفكير منخفض وعالي وأقصى. عبر كل معيار مع أكثر من 50 عينة اختبار، تفيد الشركة أن Ember-1 يقع على حدود باريتو أو بالقرب منها، ويطابق K3 بأقصى جهد مقابل جزء صغير من التكلفة ويهيمن بشكل صارم على K3 بجهد منخفض.

المقارنات الرئيسية مع K3 بأقصى جهد، كما ذكرت Fireworks:

| المعيار | عينات | K3 (الجهد الأقصى) | جمرة-1 |
|---|---|---|---|
| مقعد المحطة 2.1 | 89 | 80.9% | 82.0% |
| تم التحقق من مقاعد البدلاء SWE | 500 | 93.2% | 92.2% |
| سوي التفاعل | 75 | 21.3% | 20.0% |
| ديب سوي 1.1 | 113 | 66.4% | 75.2% |
| τ²- مقاعد البدلاء طيران | 50 | 64% | 66% |

فيما يتعلق بالتكلفة لكل مهمة، تشير Fireworks إلى أن Ember-1 خفض الإنفاق بنسبة 51.9% على Terminal Bench 2.1، و32.5% على SWE-Interact، و23.7% على DeepSWE 1.1، و15.5% على SWE-bench Verified مقارنة بـ K3 بأقصى جهد - في حالة DeepSWE، يكون الفرق أكثر من 126 دولارًا لكل وحدة عمل بالمعدلات المحسوبة للشركة.

قامت الشركة أيضًا بتقييم Ember-1 على Doximity's Bedside Bench، وهو معيار معتمد من قبل الأطباء يضم 500 حالة سريرية عبر 10 تخصصات تديرها Fireworks من خلال مؤشر الذكاء المتخصص الذي تم إطلاقه حديثًا. هناك، تقول Fireworks إن Ember-1 قد حددت حدود Pareto جديدة فيما يتعلق بالتكلفة لكل مهمة عبر كل من النماذج المفتوحة والمغلقة، بما في ذلك GPT-5.6 Sol وGPT-6 Astra وClaude Opus 5. ويأتي هذا الادعاء من فهرس Fireworks الخاص ولم يتم التحقق منه بشكل مستقل.

حركة المرور المباشرة: عدد أقل من الرموز، نفس النتائج

المعايير شيء واحد. الإنتاج شيء آخر. أجرت شركة Fireworks اختبارات A/B مباشرة مع اثنين من العملاء بشأن أعباء عمل ترميز الإنتاج لديهم، وأفادت بأن Ember-1 استخدمت عددًا أقل من الرموز بنسبة 35% تقريبًا لكل مهمة بجودة مماثلة. في إحدى المقارنات المقاسة، سجل Kimi K3 0.751 أثناء إنشاء 49,300 رمزًا مميزًا للمخرجات لكل مهمة، مقابل 0.753 لـ Ember-1 على 29,900 رمزًا مميزًا - وهو انخفاض بنسبة 71.3% في الرموز المميزة للاستدلال و39% أقل من إجمالي الرموز المميزة. بعد الاختبارات، قام أحد العملاء بنقل Ember-1 إلى الإنتاج المباشر مع خطط لتوسيع نطاقه ليحل محل النموذج الأساسي بالكامل.

داخل Fireworks نفسها، تم تبديل النموذج بهدوء إلى سير عمل الترميز الخاص بالشركة قبل الإطلاق. النتيجة التي يقول الفريق إنه يفخر بها: لم يلاحظها أحد. واصل المطورون عملهم دون اكتشاف المفتاح مع استهلاك عدد أقل بكثير من الرموز المميزة.

الاستخبارات المتخصصة كاستراتيجية

Ember-1 هو النموذج الأول في سلسلة مخططة من Fireworks Research، ويأتي جنبًا إلى جنب مع مؤشر الذكاء المتخصص الخاص بالشركة، وهو جهد قياس تم تقديمه في وقت سابق من هذا الشهر لمقارنة النماذج المفتوحة والمغلقة والمتخصصة في مهام العالم الحقيقي التي أنشأها الخبراء.

المسرحية الاستراتيجية سهلة القراءة. بدلاً من تدريب نموذج حدودي من الصفر، اتخذت شركة Fireworks نموذجًا قويًا مفتوح الوزن، ودربت عليه كفاءة الرمز المميز، وتقوم الآن ببيع نفس الإمكانية بتكلفة أقل لكل مهمة. مع استمرار الإصدارات ذات الوزن المفتوح من مختبرات مثل Moonshot في سد فجوة القدرات، يكتشف مقدمو الاستدلال أن التمايز الدائم قد يكمن في التكلفة لكل مهمة مكتملة بدلاً من المركز في قائمة المتصدرين - وهو التحول الذي يفضل الشركات التي تتمتع بتدريب قوي وبنية تحتية للخدمة.

تجدر الإشارة إلى التحذيرات بوضوح: الأرقام المذكورة أعلاه تأتي من مدونة Fireworks الخاصة، وتقييماتها الخاصة، وعملائها الذين يدفعون. سيكون النسخ المستقل لمدخرات الرمز المميز في أعباء العمل الخارجية هو الاختبار الحقيقي. ولكن إذا ثبتت النتائج، فإن الطريقة الأكثر فعالية من حيث التكلفة لتشغيل نموذج مفتوح من الفئة الحدودية ربما لم تعد تتمثل في جعله يفكر بشكل أقل - بل قد يكون تشغيل نموذج تعلم التفكير بكفاءة.
---

ابقَ في طليعة الذكاء الاصطناعي

احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →