Ornith ٹیم نے Ornith-1.5 کو جاری کیا ہے، جو ایک غیر معمولی خیال کے ارد گرد بنائے گئے کھلے وزن والے زبان کے ماڈلز کا ایک خاندان ہے: یہ ماڈل اپنے تربیتی کام خود تیار کرتا ہے، اپنے اسکافولڈز کو ڈیزائن کرتا ہے، اور مسلسل چلتے ہوئے اپنے حل کی کوششوں سے سیکھتا ہے۔ ٹیم کے اپنے جائزوں کے مطابق، فلیگ شپ Ornith-1.5-397B نے Terminal-Bench 2.1 (Terminus-2) پر 86.1 اسکور کیا، اسے Anthropic کے Claude Opus 4.8 کے 85.0 پر اور موازنہ سائز کے ہر دوسرے اوپن سورس ماڈل سے آگے رکھتا ہے۔

ریلیز، اس ہفتے Ornith بلاگ پر اور MIT لائسنس کے تحت Hugging Face پر شائع ہوئی، اوپن سورس AI ریس میں تازہ ترین سالو ہے جس نے باقاعدگی سے نتائج پیدا کیے ہیں جو ایک بار فرنٹیئر لیب کے بجٹ کے بغیر ناممکن سمجھا جاتا تھا۔ تازہ ترین AI ماڈل نیوز کو ٹریک کرنے والے ڈویلپرز اور انٹرپرائزز کے لیے، اہمیت دوگنا ہے: ایک معروف بند ماڈل کے ساتھ بینچ مارک برابری، اور ایک تربیتی نسخہ جو اس طرف اشارہ کرتا ہے کہ اوپن ماڈل کی ترقی کس طرف آگے بڑھ رہی ہے۔

تین سائز، ایک نسخہ

Ornith-1.5 تین کنفیگریشنز میں بھیجتا ہے: ایک 397B پیرامیٹر مکسچر آف ایکسپرٹس فلیگ شپ، ایک 35B MoE جو صرف 3B پیرامیٹرز فی ٹوکن کو چالو کرتا ہے، اور ایک کوانٹائزڈ "موبائل" ویرینٹ کے ساتھ ایک کمپیکٹ 9B ڈینس ماڈل جو آئی فون اور اینڈرائیڈ ڈیوائسز پر براہ راست چلانے کے لیے ڈیزائن کیا گیا ہے۔ یہ تینوں GGUF، MLX، اور NVFP4 کے ساتھ ساتھ Hugging Face پر دستیاب ہیں، اور ماڈل کارڈ اس بات کی نشاندہی کرتے ہیں کہ خاندان Qwen3.5 MoE فن تعمیر پر بنایا گیا ہے۔

یہاں نسب اہمیت رکھتا ہے۔ Ornith-1.0، جو اس سال کے شروع میں ریلیز ہوا، نے ایجنٹی کوڈنگ کے لیے "سیلف سکفولڈنگ" اپروچ کو مقبول بنایا اور یہ ایک پرسکون ہٹ بن گیا - اس کی 9B GGUF بلڈ نے Hugging Face پر 50 لاکھ سے زیادہ ڈاؤن لوڈز لاگ کیے ہیں۔ Ornith-1.5 اس فریم ورک کو سکیفولڈز اور رول آؤٹ کو بہتر بنانے سے لے کر مکمل خود کو بہتر بنانے والی پائپ لائن میں توسیع کرتا ہے۔

خود کو بہتر بنانے کا لوپ، وضاحت کی گئی۔

ایک روایتی پوسٹ ٹریننگ پائپ لائن میں، کمک سیکھنے کا کام انسانوں کے تیار کردہ کاموں کے ایک مقررہ سیٹ کے خلاف چلتا ہے۔ Ornith-1.5 میں اس کے بجائے ماڈل خود نئے کاموں کی تجویز کرتا ہے، ٹاسک کے لیے مخصوص اسکافولڈ تیار کرتا ہے — ہدایات، ٹولز، اور سڑنے کی حکمت عملی جو مسئلے پر حملہ کرنے کے لیے استعمال ہوتی ہے — اور پھر وہ حل رول آؤٹ تیار کرتا ہے جو اس نے ابھی بنائے ہوئے اسکافولڈ سے اسکور کیے ہیں۔ انعام کو GRPO کا استعمال کرتے ہوئے تینوں مراحل میں واپس پھیلایا جاتا ہے، لہذا نظام بیک وقت بہتر کام، بہتر سہاروں اور بہتر حل لکھنا سیکھتا ہے۔

ٹاسک جنریشن کا انعام ڈیزائن کا دل ہے۔ ہر مجوزہ ٹاسک کو تین ضرباتی اشاروں پر اسکور کیا جاتا ہے: درستگی (کیا اسکافولڈ درست طریقے سے انجام دیتا ہے اور اس کا اندازہ لگاتا ہے؟)، فرنٹیئر مشکل (کیا ماڈل کی تجرباتی کامیابی کی شرح تقریباً 20 فیصد کے ہدف کے قریب ہے، کاموں کو مشکل لیکن سیکھنے کے قابل رکھنا ہے؟)، اور نیاپن (کیا یہ پہلے کی ہر چیز سے کافی مختلف ہے)؟ چونکہ مشکل کو ماڈل کی اپنی موجودہ کامیابی کی شرح سے ماپا جاتا ہے، اس لیے نصاب خود بخود بڑھتا جاتا ہے جیسے جیسے ماڈل بہتر ہوتا ہے۔

ٹیم تشخیص کے دوران واضح اینٹی ہیکنگ اقدامات کی بھی اطلاع دیتی ہے: گٹ ہسٹری کو ریپوزٹری امیجز سے ہٹا دیا گیا ہے لہذا ماڈلز پہلے کے حل کو بحال نہیں کر سکتے، اور ماڈلز کو بیرونی جوابات حاصل کرنے سے روکنے کے لیے نیٹ ورک تک رسائی کو غیر فعال کر دیا گیا ہے۔ تمام نتائج کا اوسط پانچ آزاد رنز سے زیادہ ہے۔

نمبرز

ایجنٹی کوڈنگ پر، فلیگ شپ کے خود رپورٹ شدہ نتائج کا کلسٹر اوپن سورس فیلڈ کے اوپری حصے میں ہوتا ہے۔ Terminal-Bench 2.1 پر Terminus-2 ہارنس سے گزرتا ہے، Ornith-1.5-397B کا 86.1 کنارے Claude Opus 4.8 (85.0)، DeepSeek-V4-Flash-0731 (82.7)، اور GLM-5.2 (81) سے باہر ہے۔ اسی بینچ مارک پر جو کلاڈ کوڈ ہارنس کے ذریعے چلتا ہے، Ornith-1.5 Opus 4.8 کے 78.9 کے مقابلے میں 85.2 پوسٹ کرتا ہے۔ SWE-bench Verified پر، دونوں مؤثر طریقے سے 86.0 اور 85.8 پر بندھے ہوئے ہیں، Kimi K3 86.2 پر قدرے آگے ہیں۔

خلاء سخت ایجنٹی سویٹس پر وسیع ہوتا ہے۔ DeepSWE پر، Ornith-1.5-397B نے 56.0 اسکور کیا — GLM-5.2 کے 46.2 سے آگے، حالانکہ Opus 4.8 (59.0) اور Kimi K3 (67.5) سے پیچھے ہے۔ سب سے زیادہ حیرت انگیز چھلانگ نسلی ہے: Ornith-1.0 نے DeepSWE پر صرف 8.0 اسکور کیا، یعنی نئی تکرار اسی بینچ مارک فیملی میں سات گنا بہتری فراہم کرتی ہے۔

چھوٹے ماڈل اپنی کہانی سناتے ہیں۔ Ornith-1.5-35B-A3B، فی ٹوکن صرف 3B پیرامیٹرز کو چالو کرتے ہوئے، ٹرمینل-بینچ 2.1 (کلاڈ کوڈ) پر 68.5 بمقابلہ گوگل کے Gemma 4-31B کے لیے 43.4 اور Meta's Muse Glimmer-30 پر 51.7، اور Verb-30-70 پر Vernich. 9B ماڈل ٹرمینل بنچ 2.1 پر 47.0، SWE-bench Verified پر 70.6، اور GPQA ڈائمنڈ پر 86.4 تک پہنچ جاتا ہے - وہ نمبر جو فون کلاس ماڈل کو ڈیسک ٹاپ کلاس کے حریفوں سے زیادہ فاصلے پر رکھتے ہیں۔

انتباہات اور سیاق و سباق

یہ ڈویلپر کے ذریعے چلائے جانے والے بینچ مارکس ہیں، آزادانہ طور پر آڈٹ شدہ نتائج نہیں ہیں، اور موازنہ ماڈلز کا جائزہ Ornith ٹیم نے اپنی ہارنس سیٹنگز کے تحت کیا تھا۔ حریف لیبز بھی مختلف تجارتی معاہدوں کے لیے تیار ہیں۔ ڈیپ ایس ڈبلیو ای پر Kimi K3 کی برتری سے پتہ چلتا ہے کہ ایجنٹی سافٹ ویئر کے کام کا محاذ اب بھی مقابلہ ہے۔ لیکن ریلیز کی فل ٹیبل شفافیت — پانچ رنز کی اوسط، شائع شدہ ہارنس کنفیگریشنز، انکشاف شدہ حفاظتی اقدامات — آزادانہ تولید کو غیر معمولی طور پر سیدھا بناتا ہے۔

کمیونٹی کا ردعمل کافی رہا ہے۔ ریلیز کے اعلان نے گھنٹوں کے اندر ہیکر نیوز پر سو سے زیادہ پوائنٹس حاصل کیے، جس میں خود کو بہتر بنانے کے طریقہ کار کی بجائے بینچ مارک دعووں پر کم توجہ مرکوز کی گئی، جسے کئی تبصرہ نگاروں نے تکراری طرز کے ٹاسک جنریشن کے زیادہ قابل اعتماد کھلے نفاذ میں سے ایک کے طور پر بیان کیا۔

اوپن سورس ایکو سسٹم کے لیے، Ornith-1.5 ایک لمحے میں اترتا ہے جب چین کی لیبز اور مغربی آزاد ٹیموں کے کھلے ماڈلز کوڈنگ اور ایجنٹی کاموں پر بند فرنٹیئرز کے ساتھ خلا کو ختم کر رہے ہیں۔ ایک MIT-لائسنس یافتہ خاندان جو ٹرمینل-بینچ پر ایک معروف بند ماڈل سے میل کھاتا ہے — اور فون کے لیے تیار 9B ویرینٹ بھیجتا ہے — اس فرق کو مزید کم کرتا ہے، اور یہ ایک ایسے تربیتی طریقہ کے ساتھ کرتا ہے جس کا کوئی بھی معائنہ، دوبارہ تخلیق اور توسیع کر سکتا ہے۔

---

AI سے آگے رہیں

تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔

مزید AI خبریں پڑھیں →