Sakana AI مستقر در توکیو Fugu را راه اندازی کرده است، سیستمی که عملکرد یک مدل هوش مصنوعی مرزی را با هماهنگی پویا بسیاری از مدل ها به طور همزمان ارائه می دهد. به جای ساخت یک شبکه عصبی غول پیکر، Fugu خود یک مدل زبان است که برای فراخوانی سایر LLM ها از یک "حوضه عامل" قابل تعویض، جمع آوری تیمی از مدل های تخصصی برای هر کار و ترکیب خروجی آنها از طریق یک API منفرد سازگار با OpenAI آموزش دیده است.

این راه‌اندازی که توسط THE DECODER، MarkTechPost و MIT Sloan Management Review پوشش داده می‌شود، نشان‌دهنده این است که جهش بعدی در عملکرد هوش مصنوعی ممکن است کمتر از مقیاس خام و بیشتر از هماهنگی هوشمندانه‌تر مدل‌های موجود باشد. For more context on this story, see our ongoing artificial intelligence updates.

یک مدل برای فرمان دادن به همه آنها

برای کاربر، Fugu مانند یک مدل واحد رفتار می کند. در زیر هود، یا به تنهایی یک درخواست را رسیدگی می کند یا تیمی از مدل های تخصصی را گرد هم می آورد و انتخاب، تفویض اختیار، بررسی و ترکیب را به صورت داخلی مدیریت می کند. Sakana AI می‌گوید این رویکرد مبتنی بر کارهای قبلی‌اش مانند ALE-Agent است که در یک مسابقه کدنویسی با استفاده از تکنیک‌های ارکستراسیون، از بین 1000 متخصص انسانی رتبه 21 را کسب کرد.

این شرکت در حال انتشار دو نوع است. مدل پایه Fugu، تأخیر کم و عملکرد روزانه ثابت را در سراسر کدنویسی، بررسی کد و موارد استفاده از ربات‌های گفتگو هدف قرار می‌دهد و به تیم‌ها اجازه می‌دهد تا عوامل خاصی را از استخر برای حفظ حریم خصوصی یا انطباق حذف کنند. Fugu Ultra برای حداکثر کیفیت پاسخ در مسائل پیچیده و چند مرحله ای مانند بازتولید مقالات علمی، تجزیه و تحلیل امنیت سایبری، و جستجوهای پتنت و ادبیات ساخته شده است.

ادعاهای معیاری که سرها را برمی‌گردانند

طبق نتایج بنچمارک منتشر شده توسط Sakana AI، Fugu Ultra در طیف وسیعی از معیارهای کدنویسی، استدلال و علم همتراز با Anthropic's Fable 5 و Mythos Preview است. قابل ذکر است که هیچ یک از مدل های Anthropic در واقع در مجموعه نمایندگی های Fugu نیستند زیرا در دسترس عموم نیستند، به این معنی که Fugu با استفاده از مدل های دیگر به امتیازات قابل مقایسه ای رسیده است.

اعداد منتشر شده قابل توجه است. در SWE-Bench Pro، Fugu Ultra امتیاز 73.7 را به دست آورد، بالاتر از Opus 4.8 با 69.2، Gemini 3.1 Pro با 54.2 و GPT 5.5 با 58.6. در TerminalBench 2.1 امتیاز 80.2 را در مقابل Opus 4.8 82.1 کسب کرد. در LiveCodeBench به 93.2 در برابر 85.3 GPT 5.5 رسید و در Humanity's Last Exam به 50.0 رسید که بالاتر از Opus 4.8 49.8 و GPT 5.5 41.4 است.

تست های دنیای واقعی یک تصویر ترکیبی را نقاشی می کنند

بررسی های عملی اولیه نسبت به معیارها مشتاق کمتری بوده است. محقق هوش مصنوعی Ethan Mollick در X نوشت که Fugu Ultra "بسیار آهسته" است، آزمایش‌های کدگذاری معمول او 30 دقیقه طول می‌کشد و نتایجی که "خوب" بودند، اما در عمل از Fable کوتاه بودند. کاربر دیگری گزارش داد که با یک اخطار یک سهمیه 5 ساعته را در طرح 20 دلاری انجام داده است، در حالی که توسعه دهندگان در Hacker News شکایت داشتند که طرح 200 دلاری در ماه کمتر از سه ساعت در هفته زمان قابل استفاده را به همراه دارد.

بررسی کد به عنوان یک نقطه روشن ظاهر شد و تقریباً از نظر کیفیت با Opus 4.8 یا GPT 5.5 مطابقت داشت. یک آزمایش سر به سر نشان داد که Fugu Ultra یک کار کدنویسی را در 22 دقیقه با قیمت 7.32 دلار به پایان رساند، بسیار سریعتر و ارزانتر از Opus 4.8 با 79 دقیقه و 37.85 دلار، اگرچه بازبین خروجی Opus را ترجیح داد.

هوش مصنوعی ساکانا، که در سال 2023 در توکیو تأسیس شد و توسط انویدیا پشتیبانی می‌شود، هویت خود را بر اساس تحقیقات هوش مصنوعی الهام گرفته از طبیعت، با استفاده از الگوریتم‌های تکاملی و ایده‌های هوش جمعی برای فشرده کردن عملکرد بیشتر از مدل‌های موجود، ساخته است. فوگو این فلسفه را به بازار تجاری گسترش می دهد و خود ارکستراسیون را به یک محصول تبدیل می کند. این شرکت همچنین با یک سایت دوزبانه و قیمت گذاری برای توسعه دهندگان فردی و تیم های سازمانی، این سیستم را برای مخاطبان ژاپنی که نگران اتکای بیش از حد به ارائه دهندگان ایالات متحده هستند، قرار می دهد.

محافظت در برابر قفل فروشنده

فراتر از عملکرد خام، هوش مصنوعی Sakana Fugu را به عنوان محافظی در برابر وابستگی به هر ارائه‌دهنده هوش مصنوعی معرفی می‌کند. این شرکت به کنترل‌های اخیر صادرات ایالات متحده اشاره کرد که مدل‌های افسانه و میتوس آنتروپیک را از بازارهای خارجی خارج کرد تا دلیلی بر این باشد که دسترسی به سیستم‌های برتر می‌تواند یک شبه ناپدید شود.

Sakana AI در اطلاعیه خود نوشت: «برای یک سازمان یا یک ملت، تکیه بر APIهای یک شرکت برای زیرساخت‌های حیاتی، مالی یا حاکمیت یک آسیب‌پذیری مادی است. از آنجایی که استخر مدل Fugu کاملاً قابل تعویض است، اگر یکی از ارائه‌دهندگان تاریک شود، سیستم می‌تواند به مدل‌های دیگر تغییر مسیر دهد.

تحلیلگران هشدار می دهند که این همان حاکمیت واقعی نیست. عملکرد Fugu بستگی به مدل‌هایی دارد که در استخر آن قرار می‌گیرند، و چندین ارائه‌دهنده برتر که دسترسی را به یکباره محدود می‌کنند همچنان گزینه‌های آن را کوچک می‌کنند. این شرکت همچنین هنوز فاش نکرده است که لایه ارکستراسیون چقدر استفاده و هزینه توکن را افزایش می دهد. با این حال، همانطور که مدل‌های مرزی به دارایی‌های ژئوپلیتیکی تبدیل می‌شوند و قفل تک فروشنده پرخطرتر می‌شود، Fugu پیش‌نمایش صنعت هوش مصنوعی را ارائه می‌دهد که در آن هماهنگی ممکن است به اندازه توانایی مهم باشد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →