Fireworks Research، inference startup Fireworks AI کے اندر ماڈل ٹیم نے Ember-1، ایک خصوصی ماڈل متعارف کرایا ہے جس کے بارے میں کمپنی کا کہنا ہے کہ Moonshot AI کے Kimi K3 جیسے ہی جوابات تیار کرتا ہے جبکہ تقریباً 40% کم ٹوکن خارج کرتا ہے۔ یہ ماڈل 23 ستمبر کو فائر ورکس کے پلیٹ فارم پر لائیو ہوا، اور پچھلے کچھ دنوں میں یہ ڈویلپر کمیونٹی میں سب سے زیادہ زیر بحث ریلیز میں سے ایک بن گیا ہے، جس نے ہیکر نیوز پر سیکڑوں اپ ووٹ حاصل کیے ہیں کیونکہ کوڈرز نے بحث کی کہ آیا ریجننگ ٹوکن اگلی لاگت کی سرحد ہے۔
پچ ایک ایسے لمحے میں آتی ہے جب تخمینہ بل، ماڈل کی صلاحیت نہیں، تیزی سے یہ فیصلہ کرتی ہے کہ ٹیمیں کیا جہاز بھیج سکتی ہیں۔ ایجنٹوں کے کام کے بوجھ کو بجٹ استعمال کرنے والی ٹیموں کے لیے، تازہ ترین AI پیش رفت نے ایک چیز واضح کر دی ہے: اس وقت انڈسٹری کی سب سے مہنگی عادت فرنٹیئر ماڈلز کی تربیت نہیں ہے، بلکہ یہ انہیں چلا رہی ہے۔ امبر-1 فائر ورکس کی اس مسئلے پر براہ راست حملہ کرنے کی کوشش ہے، اور کمپنی نے اس کی حمایت غیر معمولی طور پر تفصیلی بینچ مارک اور پروڈکشن نمبرز کے ساتھ کی۔
سوچنے والے ماڈل بہت زیادہ سوچتے ہیں۔
Ember-1 کے پیچھے بنیادی مشاہدہ یہ ہے کہ Kimi K3 جیسے استدلال کے ماڈلز اپنے تیار کردہ ٹوکنز کی اکثریت — بعض اوقات 90% سے زیادہ، Fireworks کے مطابق — جواب کے بجائے اندرونی استدلال پر خرچ کرتے ہیں۔ ایک درخواست پر، یہ مہنگا ہے. ایجنٹی کام کے بوجھ میں، یہ مرکب ہوتا ہے: ایجنٹ کی گفتگو کا ہر موڑ ماڈل پر تمام سابقہ استدلال کو دوبارہ چلاتا ہے، اس لیے سیاق و سباق موڑ کی تعداد کے ساتھ تقریباً چوکور انداز میں بڑھتا ہے، اور ابتدائی موڑ سے طویل استدلال کے نشانات کو دوبارہ پڑھا جاتا ہے اور ہر آنے والی کال پر دوبارہ بل کیا جاتا ہے۔
فائر ورکس کا کہنا ہے کہ صارفین نے انہیں بتایا کہ وہ کم قیمت پر Kimi K3 کی کوڈنگ کی صلاحیت چاہتے ہیں، لیکن اس سے ماڈل کی استدلال کی کوشش کو ٹھکرا دینا کام نہیں ہوا - کم کوشش کی ترتیبات نے بہت زیادہ معیار کو ترک کردیا۔ اس کا متبادل یہ تھا کہ ایک ایسے ماڈل کو تربیت دی جائے جو زیادہ مؤثر طریقے سے استدلال کرتا ہے جبکہ اس کی اہمیت کو مدنظر رکھتے ہوئے ہوتا ہے۔
فضلہ نکالنے کی تربیت
کمپنی کی بلاگ پوسٹ کے مطابق، Ember-1 کی تعمیر میں 50 سے زیادہ تربیتی تجربات اور 200 سے زیادہ تشخیصات کیے گئے، جو مکمل طور پر Fireworks کے اپنے سرور لیس ٹریننگ پلیٹ فارم پر چلتے ہیں۔ ٹیم کا کہنا ہے کہ اس نے درستگی کو کھونے کے بغیر استدلال کو مختصر کرنے کے راستے میں نئے تربیتی الگورتھم تیار کیے ہیں۔
خاص طور پر، کمپنی نے تھوک کو ختم کرنے کی کوشش نہیں کی۔ Kimi K3 کی ظاہری فعلیت میں سے کچھ نتیجہ خیز خود عکاسی ہے — کسی مفروضے پر نظر ثانی کرنا، تاثرات کا جواب دینا، یا کسی نتیجے کا سراغ لگانا کسی سابقہ فیصلے سے ماڈل کو غلطیوں سے باز آنے میں مدد کرتا ہے۔ تربیتی نظام کو اس قابلیت کو برقرار رکھنے کے لیے ڈیزائن کیا گیا تھا جبکہ غیر پیداواری لوپس کو تراشتے ہوئے
تربیتی ڈیٹا میں ریاضی، کوڈنگ، ہدایات کی پیروی، گفتگو، تلاش، آلے کا استعمال، اور سافٹ ویئر انجینئرنگ شامل ہے، جس میں اسٹینڈ اکیلے مسائل اور توسیع شدہ ملٹی ٹرن تعاملات شامل ہیں۔ فائر ورکس کا کہنا ہے کہ اس نے صرف اس کا اپنا ڈیٹا استعمال کیا اور کوئی کسٹمر ڈیٹا نہیں۔
بینچ مارکس: پاریٹو فرنٹیئر پر یا اس کے قریب
لاگت کا معاملہ بنانے کے لیے، Fireworks نے Kimi K3 کی عوامی API قیمتوں کا استعمال کرتے ہوئے فی بینچ مارک لاگت کا حساب لگایا — $3 فی ملین غیر کیچڈ ان پٹ ٹوکن، $0.30 فی ملین کیشڈ ان پٹ ٹوکن، اور $15 فی ملین آؤٹ پٹ ٹوکنز — اور کم، زیادہ، اور زیادہ سے زیادہ استدلال کی کوشش پر K3 کے مقابلے Ember-1 کا موازنہ کیا۔ 50 سے زیادہ ٹیسٹ کے نمونوں کے ساتھ ہر بینچ مارک پر، کمپنی کی رپورٹ ہے کہ Ember-1 Pareto فرنٹیئر پر یا اس کے قریب بیٹھتا ہے، K3 کو زیادہ سے زیادہ کوشش پر لاگت کے ایک حصے کے لیے ملاتا ہے اور کم کوشش پر K3 پر سختی سے غلبہ حاصل کرتا ہے۔
زیادہ سے زیادہ کوشش میں K3 کے مقابلے میں سرخی کا موازنہ، جیسا کہ فائر ورکس نے رپورٹ کیا ہے:
| بینچ مارک | نمونے | K3 (زیادہ سے زیادہ کوشش) | امبر-1 |
|---|---|---|---|
| ٹرمینل بنچ 2.1 | 89 | 80.9% | 82.0% |
| SWE بینچ کی تصدیق شدہ | 500 | 93.2% | 92.2% |
| SWE-Interact | 75 | 21.3% | 20.0% |
| ڈیپ ایس ڈبلیو ای 1.1 | 113 | 66.4% | 75.2% |
| τ²-بینچ ایئر لائن | 50 | 64% | 66% |
فی ٹاسک لاگت پر، Fireworks نے رپورٹ کیا ہے کہ Ember-1 نے ٹرمینل بنچ 2.1 پر اخراجات میں 51.9%، SWE-Interact پر 32.5%، DeepSWE 1.1 پر 23.7%، اور SWE-bench پر 15.5% زیادہ سے زیادہ کوشش کے ساتھ K3 کے مقابلے میں 15.5% کی کٹوتی کی ہے - ڈیپ ایس ڈبلیو ای کی صورت میں، کمپنی کے فی یونٹ $1 سے زیادہ $1 کیل کام کا فرق شرحیں
کمپنی نے Doximity's Bedside Bench پر Ember-1 کا بھی جائزہ لیا، جو کہ 10 اسپیشلٹیز میں 500 کلینیکل کیسز کا ایک فزیشن سے تصدیق شدہ بینچ مارک ہے جو Fireworks اپنے نئے شروع کیے گئے اسپیشلائزڈ انٹیلی جنس انڈیکس کے ذریعے چلاتا ہے۔ وہاں، Fireworks کا کہنا ہے کہ Ember-1 نے کھلے اور بند دونوں ماڈلز میں فی ٹاسک لاگت پر ایک نیا پاریٹو فرنٹیئر مقرر کیا، بشمول GPT-5.6 Sol، GPT-6 Astra، اور Claude Opus 5۔ یہ دعویٰ فائر ورکس کے اپنے انڈیکس سے آیا ہے اور اس کی آزادانہ طور پر تصدیق نہیں ہوئی ہے۔
لائیو ٹریفک: کم ٹوکن، ایک جیسے اسکور
معیارات ایک چیز ہیں؛ پیداوار ایک اور ہے. فائر ورکس نے دو صارفین کے ساتھ اپنے پروڈکشن کوڈنگ کے کام کے بوجھ پر لائیو A/B ٹیسٹ چلائے اور رپورٹس کہ Ember-1 نے تقابلی معیار پر تقریباً 35% کم ٹوکن فی کام استعمال کیا۔ ایک ناپے گئے مقابلے میں، Kimi K3 نے فی ٹاسک 49,300 آؤٹ پٹ ٹوکنز تیار کرتے ہوئے 0.751 اسکور کیا، جبکہ Ember-1 کے لیے 0.753 کے مقابلے میں 29,900 ٹوکنز - ریجننگ ٹوکنز میں 71.3% کمی اور کل ٹوکنز میں 39% کم۔ ٹیسٹوں کے بعد، ایک گاہک نے امبر-1 کو لائیو پروڈکشن میں منتقل کر دیا جس کے ساتھ اس کو بڑے پیمانے پر بیس ماڈل کو مکمل طور پر تبدیل کرنے کا منصوبہ بنایا گیا۔
خود فائر ورکس کے اندر، ماڈل کو لانچ سے پہلے خاموشی سے کمپنی کے اپنے کوڈنگ ورک فلوز میں تبدیل کر دیا گیا تھا۔ ٹیم کا کہنا ہے کہ جس نتیجہ پر اسے فخر ہے: کسی نے توجہ نہیں دی۔ کافی حد تک کم ٹوکن استعمال کرتے ہوئے ڈویلپرز نے سوئچ کا پتہ لگائے بغیر اپنا کام جاری رکھا۔
ایک حکمت عملی کے طور پر خصوصی ذہانت
Ember-1 فائر ورکس ریسرچ کی جانب سے ایک منصوبہ بند سیریز کا پہلا ماڈل ہے، اور یہ کمپنی کے سپیشلائزڈ انٹیلی جنس انڈیکس کے ساتھ آتا ہے، ایک بینچ مارکنگ کی کوشش جو اس ماہ کے شروع میں کھلے، بند، اور ماہر کی تخلیق کردہ حقیقی دنیا کے کاموں پر خصوصی ماڈلز کا موازنہ کرنے کے لیے متعارف کرائی گئی تھی۔
اسٹریٹجک کھیل پڑھنا آسان ہے۔ ایک فرنٹیئر ماڈل کو شروع سے تربیت دینے کے بجائے، Fireworks نے ایک مضبوط اوپن ویٹ ماڈل لیا، اس میں ٹوکن کی کارکردگی کو تربیت دی، اور اب اسی صلاحیت کو فی کام کم قیمت پر فروخت کر رہا ہے۔ جیسا کہ مون شاٹ جیسی لیبز سے کھلے وزن کی ریلیز صلاحیت کے فرق کو بند کرتی رہتی ہے، اندازہ فراہم کرنے والے یہ دریافت کر رہے ہیں کہ پائیدار تفریق لیڈر بورڈ پوزیشن کے بجائے فی مکمل کام کی لاگت میں ہوسکتی ہے - ایک ایسی تبدیلی جو مضبوط تربیت اور خدمات فراہم کرنے والے انفراسٹرکچر والی کمپنیوں کے حق میں ہے۔
انتباہات واضح طور پر بیان کرنے کے قابل ہیں: اوپر دیے گئے نمبر فائر ورکس کے اپنے بلاگ، اس کے اپنے تجزیوں، اور اس کے اپنے ادائیگی کرنے والے صارفین سے آتے ہیں۔ باہر کے کام کے بوجھ پر ٹوکن کی بچت کی آزادانہ نقل ہی اصل امتحان ہوگا۔ لیکن اگر نتائج برقرار رہتے ہیں تو فرنٹیئر کلاس اوپن ماڈل کو چلانے کا سب سے زیادہ سرمایہ کاری مؤثر طریقہ یہ نہیں ہو سکتا کہ اسے کم سوچنے پر مجبور کیا جائے - یہ ایسا ماڈل چلانا ہو سکتا ہے جس نے موثر انداز میں سوچنا سیکھا ہو۔
---
تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔
مزید AI خبریں پڑھیں →