أطلقت شركة Sakana AI، ومقرها طوكيو، نظام Fugu، وهو نظام يقدم أداء نموذج الذكاء الاصطناعي الحدودي من خلال التنسيق الديناميكي للعديد من النماذج في وقت واحد. بدلاً من بناء شبكة عصبية عملاقة واحدة، يعد Fugu في حد ذاته نموذجًا لغويًا تم تدريبه لاستدعاء ماجستير إدارة الأعمال الآخرين من "مجموعة وكلاء" قابلة للتبديل، حيث يقوم بتجميع فريق من النماذج المتخصصة لكل مهمة وتجميع مخرجاتها من خلال واجهة برمجة تطبيقات واحدة متوافقة مع OpenAI.

يمثل الإطلاق، الذي غطته THE DECODER وMarkTechPost وMIT Sloan Management Review، رهانًا على أن القفزة التالية في أداء الذكاء الاصطناعي قد تأتي بدرجة أقل من النطاق الأولي وأكثر من التنسيق الأكثر ذكاءً للنماذج الموجودة بالفعل. لمزيد من السياق حول هذه القصة، راجع أخبار الذكاء الاصطناعي.

نموذج واحد للسيطرة عليهم جميعًا

بالنسبة للمستخدم، يتصرف Fugu كنموذج واحد. تحت الغطاء، فهو إما يتعامل مع الطلب من تلقاء نفسه أو يجمع فريقًا من النماذج المتخصصة، لإدارة الاختيار والتفويض والتحقق والتوليف داخليًا. تقول Sakana AI إن هذا النهج يعتمد على أعمال سابقة مثل ALE-Agent، التي وضعت المركز 21 من بين 1000 خبير بشري في مسابقة برمجة باستخدام تقنيات التنسيق.

تقوم الشركة بإصدار نوعين مختلفين. يستهدف نموذج Fugu الأساسي زمن استجابة منخفض وأداء يومي قوي عبر البرمجة ومراجعة التعليمات البرمجية وحالات استخدام روبوتات الدردشة، ويتيح للفرق استبعاد وكلاء محددين من المجموعة لأغراض الخصوصية أو الامتثال. تم تصميم Fugu Ultra للحصول على أقصى جودة للإجابة على المشكلات المعقدة ومتعددة الخطوات مثل إعادة إنتاج الأوراق العلمية، وتحليل الأمن السيبراني، والبحث عن براءات الاختراع والأدبيات.

المطالبات المعيارية التي تلفت الأنظار

وفقًا للنتائج المعيارية التي نشرتها Sakana AI، فإن أداء Fugu Ultra على قدم المساواة مع Anthropic's Fable 5 وMythos Preview عبر مجموعة من معايير البرمجة والاستدلال والعلوم. والجدير بالذكر أن أيًا من النموذجين الأنثروبيين غير موجود فعليًا في مجموعة وكلاء Fugu لأنهما غير متاحين للعامة، مما يعني أن Fugu وصلت إلى نتائج قابلة للمقارنة باستخدام نماذج أخرى.

والأرقام المنشورة مذهلة. في SWE-Bench Pro، سجلت Fugu Ultra 73.7 نقطة، متقدمة على Opus 4.8 عند 69.2، وGemini 3.1 Pro عند 54.2، وGPT 5.5 عند 58.6. في TerminalBench 2.1، سجل 80.2 مقابل 82.1 لـ Opus 4.8. في LiveCodeBench وصل إلى 93.2 مقابل 85.3 لـ GPT 5.5، وفي الاختبار الأخير لـ Humanity، سجل 50.0، متجاوزًا Opus 4.8 بـ 49.8 وGPT 5.5 بـ 41.4.

اختبارات العالم الحقيقي ترسم صورة مختلطة

كانت المراجعات العملية المبكرة أقل حماسة من المعايير. كتب باحث الذكاء الاصطناعي إيثان موليك على X أن Fugu Ultra "بطيء بشكل لا يصدق"، حيث تستغرق اختبارات الترميز المعتادة 30 دقيقة وكانت النتائج "جيدة" ولكنها لم ترقى إلى مستوى Fable في الممارسة العملية. أبلغ مستخدم آخر عن تجاوز حصة كاملة مدتها خمس ساعات على خطة 20 دولارًا بمطالبة واحدة، بينما اشتكى مطورو Hacker News من أن خطة 200 دولار شهريًا تنتج أقل من ثلاث ساعات أسبوعيًا من الوقت القابل للاستخدام.

ظهرت مراجعات الأكواد كنقطة مضيئة، حيث تطابق تقريبًا جودة Opus 4.8 أو GPT 5.5. أظهر أحد الاختبارات المباشرة أن Fugu Ultra أنهى مهمة ترميز في 22 دقيقة مقابل 7.32 دولار، وهو أسرع بكثير وأرخص من Opus 4.8 الذي استغرق 79 دقيقة و37.85 دولارًا، على الرغم من أن المراجع فضل مخرجات Opus.

قامت شركة Sakana AI، التي تأسست في طوكيو عام 2023 وبدعم من شركة Nvidia، ببناء هويتها على أبحاث الذكاء الاصطناعي المستوحاة من الطبيعة، باستخدام الخوارزميات التطورية وأفكار الذكاء الجماعي لاستخراج المزيد من الأداء من النماذج الحالية. توسع شركة Fugu هذه الفلسفة إلى السوق التجارية، وتحول التنسيق نفسه إلى منتج. تقوم الشركة أيضًا بوضع النظام للجمهور الياباني القلق بشأن الاعتماد المفرط على مقدمي الخدمة الأمريكيين، من خلال موقع ثنائي اللغة وأسعار تستهدف المطورين الأفراد وفرق المؤسسات.

التحوط ضد حبس البائع

بالإضافة إلى الأداء الأولي، تقدم Sakana AI عرضًا لـ Fugu كضمان ضد الاعتماد على أي مزود ذكاء اصطناعي واحد. وأشارت الشركة إلى ضوابط التصدير الأمريكية الأخيرة التي سحبت نماذج Anthropic's Fable وMythos من الأسواق الخارجية كدليل على أن الوصول إلى الأنظمة العليا يمكن أن يختفي بين عشية وضحاها.

وكتبت Sakana AI في إعلانها: "بالنسبة لمنظمة أو دولة، فإن الاعتماد على واجهات برمجة التطبيقات الخاصة بشركة واحدة للبنية التحتية الحيوية أو التمويل أو الحوكمة يمثل نقطة ضعف مادية". ونظرًا لأن مجموعة نماذج Fugu قابلة للتبديل بالكامل، فيمكن للنظام إعادة التوجيه إلى نماذج أخرى في حالة توقف أحد الموفرين عن العمل.

ويحذر المحللون من أن هذا ليس هو نفس السيادة الحقيقية. يعتمد أداء Fugu على النماذج الموجودة في مجموعته، والعديد من كبار مقدمي الخدمات الذين يقيدون الوصول في وقت واحد سيظلون يقلصون خياراته. كما لم تكشف الشركة بعد عن مدى زيادة استخدام طبقة التنسيق وتكلفة الرمز المميز. ومع ذلك، مع تحول النماذج الحدودية إلى أصول جيوسياسية وتزايد خطورة تقييد بائع واحد، تقدم Fugu معاينة لصناعة الذكاء الاصطناعي حيث قد يكون التنسيق مهمًا بقدر أهمية القدرة.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →