کوگنیشن، ڈیوین AI سافٹ ویئر انجینئر کے پیچھے کام کرنے والی کمپنی نے جمعرات کو SWE-2 کو لانچ کیا، اسے ابھی تک کا سب سے جدید کوڈنگ ماڈل قرار دیا۔ 10 ستمبر کو شائع ہونے والی ایک بلاگ پوسٹ میں، کمپنی نے کہا کہ نیا ماڈل اس کو آگے بڑھاتا ہے جسے وہ صلاحیت اور لاگت کے پاریٹو فرنٹیئر کہتا ہے، فرنٹیئر کوڈ 1.1 مین بینچ مارک پر 50.0% اسکور کرتا ہے جبکہ اس کی لاگت Fable 5.1 سے 64% کم ہے، جو کہ انتھروپک ماڈل ہے جو اس سے صرف ایک پوائنٹ آگے ہے۔

کوگنیشن کی جانب سے 48 بلین ڈالر کی قیمت پر 2 بلین ڈالر کے فنڈنگ ​​راؤنڈ کی تصدیق کرنے کے بمشکل ایک دن بعد لانچ ہوا، اور یہ اشارہ کرتا ہے کہ ایجنٹ کوڈنگ اسٹارٹ اپ کس قدر جارحانہ طریقے سے اپنے ماڈل کی ترقی میں سرمایہ کاری کر رہا ہے بجائے اس کے کہ مکمل طور پر تھرڈ پارٹی فرنٹیئر ماڈلز پر انحصار کرے۔ AI کوڈنگ ریس کی مسلسل کوریج اور انڈسٹری کو منتقل کرنے والی ہر چیز کے لیے، بک مارک AI Buzz Wire، AI خبروں کی بریکنگ کے لیے اپنا روزانہ کا ذریعہ۔

جہاں SWE-2 بینچ مارکس پر اترتا ہے۔

Cognition کے شائع شدہ نتائج کے مطابق، SWE-2 نے FrontierCode 1.1 Main پر 50.0% پوسٹ کیا، Grok 4.6 سے 48.0% پر اور GPT-5.6 Sol سے 47.5% پر، اور GPT-6 Astra کے نمایاں فاصلے کے اندر، جو 53.3% پر فیلڈ کی قیادت کرتا ہے۔ ڈیپ ایس ڈبلیو ای 1.1 بینچ مارک پر، ایس ڈبلیو ای-2 73.0 فیصد تک پہنچ گیا، ماڈلز کوگنیشن لسٹوں میں ایسٹرا کے 74.1 فیصد کے بعد دوسرے نمبر پر ہے۔

سب سے مضبوط نمائش Terminal-Bench 2.1 پر آتی ہے، جہاں SWE-2 نے 92.8% اسکور کیا، جو کوگنیشن کے موازنہ ٹیبل میں سب سے زیادہ اور Fable 5.1 سے 91.4% پر اور GPT-6 Astra سے 89.9% پر آگے ہے۔ مشکل ٹرمینل بنچ 4 پر تصویر بدل جاتی ہے، جہاں SWE-2 GPT-6 Astra کے لیے 57.9% کے مقابلے میں 27.3% اور Fable 5.1 کے لیے 55.8% کا انتظام کرتا ہے، یہ ایک یاد دہانی ہے کہ ماڈل کی کارکردگی کا پہلا ڈیزائن کام کی مشکل کے بالکل اوپری حصے میں ہیڈ روم چھوڑ دیتا ہے۔

کوگنیشن نے پوزیشننگ کو دو ٹوک انداز میں جمع کیا: فرنٹیئر کوڈ 1.1 مین اور ڈیپ ایس ڈبلیو ای 1.1 پر، ایس ڈبلیو ای-2 اسکور اور لاگت دونوں پر اپنے سابقہ ماڈل ایس ڈبلیو ای-1.7 اور گروک 4.6 کو پیچھے چھوڑتا ہے، جی پی ٹی-5.6 سول اور فیبل 5/5.1 سے ان کی قیمت کے ایک حصے پر میچ کرتا ہے، اور جی پی ٹی کے چند ایک پوائنٹ کے اندر آتا ہے۔ لاگت

ملٹی ٹریلین اسکیل پر Kimi K3 سے بعد از تربیت

SWE-2 شروع سے نہیں بنایا گیا ہے۔ کوگنیشن نے ماڈل کو Kimi K3 سے تربیت دی، جو Moonshot AI کا 2.8-ٹریلین پیرامیٹر بیس ماڈل ہے جو پہلے ہی ایجنٹی کوڈنگ کے لیے وسیع پیمانے پر کمک سیکھ چکا تھا۔ اس فاؤنڈیشن کے اوپری حصے میں، کوگنیشن کا کہنا ہے کہ اس کے RL عمل نے کئی بینچ مارکس پر پانچ سے چھ پوائنٹس کا اضافہ کیا اور K3 کی پوری لاگت کی کارکردگی کی سرحد کو منتقل کر دیا۔

کمپنی کا کہنا ہے کہ SWE-2 پہلی بار ہے جب اس نے تربیت کے بنیادی ڈھانچے اور SWE-1.7 کے لیے تیار کردہ ترکیب پر تعمیر کرتے ہوئے ملٹی ٹریلین پیرامیٹر رجیم کے لیے کمک سیکھنے کو بڑھایا ہے۔ کلیدی اضافہ ایک RL الگورتھم ہے جو کم، درمیانے اور زیادہ کوششوں کو الگ الگ تربیتی اہداف کے طور پر سمجھنے کے بجائے ایک ہی دوڑ میں تمام استدلال کی کوششوں کی سطح کو تربیت دیتا ہے۔

لاگت کے جرمانے پوری سرحد کو تشکیل دیتے ہیں۔

SWE-2 کی تربیت میں ایک مرکزی خیال ایک لکیری لاگت کا جرمانہ ہے جو ایک واحد RL رن کے اندر ہر کوشش کی سطح پر لاگو ہوتا ہے، ہر جرمانے کو بیس ماڈل کے Pareto فرنٹیئر کے مقامی ڈھلوان کے ساتھ جوڑا جاتا ہے۔ ادراک کا کہنا ہے کہ یہ نقطہ نظر، پہلے اصولوں سے اخذ کیا گیا ہے، ماڈل کی تمام لاگت کی کارکردگی کے محاذ کو آگے بڑھاتا ہے جبکہ اس کی شکل کو محفوظ رکھتا ہے اور تربیت میں براہ راست صارف کے حقیقی اخراجات کی عکاسی کرتا ہے۔

کمپنی نے SWE-1.6 کے بعد سے استعمال ہونے والی طوالت کے وزن والے انعامی بیس لائن کی بھی تفصیل دی، جس کا سہرا یہ نمایاں طور پر مستحکم ٹریننگ کے ساتھ، RL رول آؤٹ سرونگ میں بہتری کے ساتھ دیتا ہے جس میں ڈی کوڈنگ تھرو پٹ کو بڑھانے کے لیے ایک آن لائن ڈرافٹ ماڈل شامل ہے۔ NVFP4 اور FP8 کرنل اور کوانٹائزیشن سے آگاہی کی تربیت کے ساتھ، Cognition کا کہنا ہے کہ اس نے مجموعی طور پر میموری کے استعمال کو کم کر دیا ہے حالانکہ بیس ماڈل اپنے پیشرو کے پیرامیٹرز سے تقریباً تین گنا زیادہ ہے۔

ٹریننگ ڈیٹا پائپ لائن میں بھی توسیع ہوئی: ادراک نے RL ماحولیات کی تعداد میں تین گنا اضافہ کیا، ہدایات کے بعد اوورلیز کا اضافہ کیا، اور سابقہ ​​SWE-2 چوکیوں سے چلنے والا فلائی وہیل بنایا جو ماڈل کو اسکور کرنے کے لیے استعمال ہونے والے تصدیق کنندگان کو بار بار سخت کرتا ہے۔

صلاحیت جتنی ذہانت

ادراک SWE-2 کے فوائد کو کارکردگی سے قریب سے منسلک کرتا ہے۔ کمپنی کا کہنا ہے کہ انجینئرنگ کا مضبوط فیصلہ، ایجنٹ کو کم راستوں اور بے کار پڑھنے کے ساتھ مزید مکمل حل لکھنے دیتا ہے۔ فرنٹیئر کوڈ 1.1 مین پر، SWE-2 کی درمیانی کوشش کی ترتیب SWE-1.7 سے زیادہ اسکور کرتی ہے جبکہ 58% کم موڑ لیتے ہیں اور لاگت 81% کم ہوتی ہے۔

یہ فریمنگ کوگنیشن کے کاروبار کے لیے اہمیت رکھتی ہے۔ ڈیوین کو ایک خود مختار سافٹ ویئر انجینئر کے طور پر فروخت کیا جاتا ہے، اور تخمینہ لاگت قیمتوں اور مارجن کے لیے براہ راست ان پٹ ہے۔ ایک ایسا ماڈل جو فرنٹیئر سے ملحقہ معیار رکھتا ہے جبکہ ہر کام کے موڑ اور ٹوکنز کاٹتا ہے، کمپنی کی طرف سے پیش کیے جانے والے ہر ڈیوین سیشن کی معاشیات کو تبدیل کرتی ہے۔

دستیابی

SWE-2 آج سے ڈیوین ڈیسک ٹاپ اور ڈیوین سی ایل آئی میں دستیاب ہے، کمپنی کے مطابق، ڈیوین ویب اور فیوژن پر رول آؤٹ کے ساتھ۔ کوگنیشن کا کہنا ہے کہ آنے والے دنوں میں صارفین کو ماڈل کو سطحوں پر ظاہر ہونا چاہیے۔

کوڈنگ ماڈل مارکیٹ کے لیے اس کا کیا مطلب ہے۔

ریلیز GPT-6 Astra کے پیچھے پہلے سے ہجوم والے پیک کو سخت کرتی ہے۔ Cognition اب ایک ایسے ماڈل کا مالک ہے جو نمایاں طور پر کم قیمت پر Anthropic، OpenAI اور xAI کی پیشکشوں کے ساتھ تجارت کرتا ہے، اور یہ ماڈل سے ایجنٹ پروڈکٹ تک مکمل اسٹیک کو کنٹرول کرتا ہے۔ حریفوں کو صلاحیت کے مطابق قیمت پر جواب دینے کے لیے دباؤ کا سامنا کرنا پڑے گا، خاص طور پر اعلیٰ حجم، درمیانے درجے کے مشکل کاموں کے لیے جہاں SWE-2 کی لاگت کا پروفائل سب سے مضبوط ہے۔

AI کوڈنگ ٹولز کے خریداروں کے لیے، عملی فائدہ یہ ہے کہ فرنٹیئر لیول کوڈنگ مدد کو فرنٹیئر لیول کی قیمتوں کی ضرورت نہیں ہے۔ باقی صنعت کے لیے، SWE-2 اس بات کا ثبوت ہے کہ پوسٹ ٹریننگ اور انفراسٹرکچر کی کارکردگی، نہ صرف بیس ماڈل اسکیل، ایک فیصلہ کن مسابقتی لیور بن گئی ہے۔

---

AI سے آگے رہیں

تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔

مزید AI خبریں پڑھیں →