ٹوکیو میں مقیم Sakana AI نے Fugu شروع کیا ہے، ایک ایسا نظام جو ایک ہی وقت میں متعدد ماڈلز کو متحرک طور پر مربوط کرکے فرنٹیئر AI ماڈل کی کارکردگی فراہم کرتا ہے۔ ایک بڑا نیورل نیٹ ورک بنانے کے بجائے، Fugu بذات خود ایک لینگویج ماڈل ہے جو دوسرے LLMs کو تبدیل کرنے کے قابل "ایجنٹ پول" سے بلانے کے لیے تربیت یافتہ ہے، جو ہر کام کے لیے خصوصی ماڈلز کی ایک ٹیم کو جمع کرتا ہے اور ایک OpenAI-مطابقت پذیر API کے ذریعے اپنے آؤٹ پٹ کی ترکیب کرتا ہے۔
لانچ، جس کا احاطہ ڈیکوڈر، مارک ٹیک پوسٹ، اور ایم آئی ٹی سلوان مینجمنٹ ریویو نے کیا ہے، اس شرط کی نمائندگی کرتا ہے کہ AI کارکردگی میں اگلی چھلانگ خام پیمانے سے کم اور پہلے سے موجود ماڈلز کے بہتر کوآرڈینیشن سے زیادہ ہوسکتی ہے۔ For more context on this story, see our ongoing AI industry coverage.
ان سب کو حکم دینے کے لیے ایک ماڈل
صارف کے لیے، Fugu ایک ماڈل کی طرح برتاؤ کرتا ہے۔ ہڈ کے تحت، یہ یا تو اپنے طور پر ایک درخواست کو سنبھالتا ہے یا مخصوص ماڈلز کی ایک ٹیم کو اکٹھا کرتا ہے، انتخاب، وفد، جانچ، اور ترکیب کو اندرونی طور پر منظم کرتا ہے۔ Sakana AI کا کہنا ہے کہ نقطہ نظر اس کے ALE-Agent جیسے پہلے کام پر استوار ہے، جس نے آرکیسٹریشن تکنیک کا استعمال کرتے ہوئے کوڈنگ مقابلے میں 1,000 انسانی ماہرین میں سے 21 ویں نمبر پر رکھا۔
کمپنی دو قسمیں جاری کر رہی ہے۔ بیس Fugu ماڈل کوڈنگ، کوڈ کا جائزہ لینے، اور چیٹ بوٹ کے استعمال کے معاملات میں کم تاخیر اور روزمرہ کی ٹھوس کارکردگی کو نشانہ بناتا ہے، اور ٹیموں کو رازداری یا تعمیل کے لیے پول سے مخصوص ایجنٹوں کو خارج کرنے دیتا ہے۔ Fugu Ultra پیچیدہ، کثیر الجہتی مسائل جیسے کہ سائنسی کاغذات کو دوبارہ تیار کرنا، سائبرسیکیوریٹی تجزیہ، اور پیٹنٹ اور ادب کی تلاش پر زیادہ سے زیادہ جوابی معیار کے لیے بنایا گیا ہے۔
بینچ مارک کے دعوے جو سر بدل جاتے ہیں۔
Sakana AI کے شائع کردہ بینچ مارک نتائج کے مطابق، Fugu Ultra کوڈنگ، استدلال، اور سائنس کے معیارات کی ایک حد میں Anthropic's Fable 5 اور Mythos Preview کے برابر کارکردگی کا مظاہرہ کرتا ہے۔ خاص طور پر، کوئی بھی انتھروپک ماڈل دراصل Fugu کے ایجنٹ پول میں نہیں ہے کیونکہ وہ عوامی طور پر دستیاب نہیں ہیں، یعنی Fugu دوسرے ماڈلز کا استعمال کرتے ہوئے تقابلی اسکور تک پہنچ گیا۔
شائع شدہ نمبر حیران کن ہیں۔ SWE-Bench Pro پر، Fugu Ultra نے 73.7 اسکور کیا، Opus 4.8 سے آگے 69.2 پر، Gemini 3.1 Pro نے 54.2 پر، اور GPT 5.5 نے 58.6 پر۔ ٹرمینل بینچ 2.1 پر اس نے Opus 4.8 کے 82.1 کے مقابلے میں 80.2 اسکور کیا۔ LiveCodeBench پر یہ GPT 5.5 کے 85.3 کے مقابلے میں 93.2 تک پہنچ گیا، اور Humanity's Last Exam پر اس نے Opus 4.8 کے 49.8 اور GPT 5.5 کے 41.4 کے مقابلے میں 50.0 پوسٹ کیا۔
حقیقی دنیا کے ٹیسٹ ایک مخلوط تصویر پینٹ کرتے ہیں۔
ابتدائی جائزے بینچ مارکس سے کم پرجوش رہے ہیں۔ اے آئی کے محقق ایتھن مولک نے X پر لکھا کہ فوگو الٹرا "ناقابل یقین حد تک سست" ہے، اس کے معمول کے کوڈنگ ٹیسٹوں میں 30 منٹ لگتے ہیں اور نتائج جو "ٹھیک" تھے لیکن عملی طور پر Fable سے کم تھے۔ ایک اور صارف نے ایک ہی پرامپٹ کے ساتھ $20 کے پلان پر پورے پانچ گھنٹے کے کوٹہ کو اڑانے کی اطلاع دی، جب کہ ہیکر نیوز پر ڈویلپرز نے شکایت کی کہ $200-فی-ماہ کے منصوبے سے ہفتے میں تین گھنٹے سے بھی کم وقت استعمال ہوتا ہے۔
کوڈ کے جائزے ایک روشن مقام کے طور پر ابھرے ہیں، جو معیار میں Opus 4.8 یا GPT 5.5 سے تقریباً مماثل ہیں۔ ایک سر سے سر ٹیسٹ نے دکھایا کہ فوگو الٹرا نے 22 منٹ میں کوڈنگ کا کام $7.32 میں مکمل کیا، جو Opus 4.8 کے 79 منٹ اور $37.85 سے کہیں زیادہ تیز اور سستا ہے، حالانکہ جائزہ لینے والے نے Opus کے آؤٹ پٹ کو ترجیح دی۔
Sakana AI، جو ٹوکیو میں 2023 میں قائم کیا گیا تھا اور Nvidia کی حمایت یافتہ ہے، نے موجودہ ماڈلز سے زیادہ کارکردگی کو نچوڑنے کے لیے ارتقائی الگورتھم اور اجتماعی ذہانت کے خیالات کا استعمال کرتے ہوئے فطرت سے متاثر AI تحقیق پر اپنی شناخت بنائی ہے۔ فوگو اس فلسفے کو تجارتی مارکیٹ تک پھیلاتا ہے، آرکیسٹریشن کو خود کو ایک پروڈکٹ میں بدل دیتا ہے۔ کمپنی ایک دو لسانی سائٹ اور انفرادی ڈویلپرز اور انٹرپرائز ٹیموں دونوں کے مقصد سے قیمتوں کے تعین کے ساتھ، امریکی فراہم کنندگان پر زیادہ انحصار کے بارے میں فکر مند جاپانی سامعین کے لیے بھی نظام کو ترتیب دے رہی ہے۔
وینڈر لاک ان کے خلاف ایک ہیج
خام کارکردگی کے علاوہ، Sakana AI Fugu کو کسی ایک AI فراہم کنندہ پر انحصار کے خلاف تحفظ کے طور پر پیش کر رہا ہے۔ کمپنی نے حالیہ امریکی برآمدی کنٹرولز کی طرف اشارہ کیا جس نے غیر ملکی منڈیوں سے اینتھروپک کے فیبل اور میتھوس ماڈلز کو اس بات کے ثبوت کے طور پر نکالا کہ ٹاپ سسٹمز تک رسائی راتوں رات ختم ہو سکتی ہے۔
Sakana AI نے اپنے اعلان میں لکھا، "کسی تنظیم یا قوم کے لیے، اہم انفراسٹرکچر، فنانس، یا گورننس کے لیے کسی ایک کمپنی کے APIs پر انحصار کرنا ایک مادی کمزوری ہے۔" چونکہ فوگو کا ماڈل پول مکمل طور پر تبدیل کیا جا سکتا ہے، اگر ایک فراہم کنندہ اندھیرے میں چلا جاتا ہے تو سسٹم دوسرے ماڈلز کی طرف روٹ کر سکتا ہے۔
تجزیہ کار خبردار کرتے ہیں کہ یہ حقیقی خودمختاری کی طرح نہیں ہے۔ فوگو کی کارکردگی کا انحصار اس بات پر ہے کہ اس کے پول میں کون سے ماڈلز بیٹھتے ہیں، اور ایک ساتھ رسائی پر پابندی لگانے والے کئی اعلیٰ فراہم کنندگان اب بھی اس کے اختیارات کو کم کر دیں گے۔ کمپنی نے ابھی تک یہ بھی ظاہر نہیں کیا ہے کہ آرکیسٹریشن پرت ٹوکن کے استعمال اور لاگت کو کتنا بڑھاتی ہے۔ پھر بھی، جیسے جیسے فرنٹیئر ماڈلز جیو پولیٹیکل اثاثے بن جاتے ہیں اور سنگل وینڈر لاک اِن خطرے میں بڑھتا جاتا ہے، فوگو ایک AI صنعت کا پیش نظارہ پیش کرتا ہے جہاں کوآرڈینیشن کی صلاحیت سے زیادہ اہمیت ہو سکتی ہے۔
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



