Sakana AI مستقر در توکیو Fugu را راه اندازی کرده است، سیستمی که عملکرد یک مدل هوش مصنوعی مرزی را با هماهنگی پویا بسیاری از مدل ها به طور همزمان ارائه می دهد. به جای ساخت یک شبکه عصبی غول پیکر، Fugu خود یک مدل زبان است که برای فراخوانی سایر LLM ها از یک "حوضه عامل" قابل تعویض، جمع آوری تیمی از مدل های تخصصی برای هر کار و ترکیب خروجی آنها از طریق یک API منفرد سازگار با OpenAI آموزش دیده است.
این راهاندازی که توسط THE DECODER، MarkTechPost و MIT Sloan Management Review پوشش داده میشود، نشاندهنده این است که جهش بعدی در عملکرد هوش مصنوعی ممکن است کمتر از مقیاس خام و بیشتر از هماهنگی هوشمندانهتر مدلهای موجود باشد. For more context on this story, see our ongoing artificial intelligence updates.
یک مدل برای فرمان دادن به همه آنها
برای کاربر، Fugu مانند یک مدل واحد رفتار می کند. در زیر هود، یا به تنهایی یک درخواست را رسیدگی می کند یا تیمی از مدل های تخصصی را گرد هم می آورد و انتخاب، تفویض اختیار، بررسی و ترکیب را به صورت داخلی مدیریت می کند. Sakana AI میگوید این رویکرد مبتنی بر کارهای قبلیاش مانند ALE-Agent است که در یک مسابقه کدنویسی با استفاده از تکنیکهای ارکستراسیون، از بین 1000 متخصص انسانی رتبه 21 را کسب کرد.
این شرکت در حال انتشار دو نوع است. مدل پایه Fugu، تأخیر کم و عملکرد روزانه ثابت را در سراسر کدنویسی، بررسی کد و موارد استفاده از رباتهای گفتگو هدف قرار میدهد و به تیمها اجازه میدهد تا عوامل خاصی را از استخر برای حفظ حریم خصوصی یا انطباق حذف کنند. Fugu Ultra برای حداکثر کیفیت پاسخ در مسائل پیچیده و چند مرحله ای مانند بازتولید مقالات علمی، تجزیه و تحلیل امنیت سایبری، و جستجوهای پتنت و ادبیات ساخته شده است.
ادعاهای معیاری که سرها را برمیگردانند
طبق نتایج بنچمارک منتشر شده توسط Sakana AI، Fugu Ultra در طیف وسیعی از معیارهای کدنویسی، استدلال و علم همتراز با Anthropic's Fable 5 و Mythos Preview است. قابل ذکر است که هیچ یک از مدل های Anthropic در واقع در مجموعه نمایندگی های Fugu نیستند زیرا در دسترس عموم نیستند، به این معنی که Fugu با استفاده از مدل های دیگر به امتیازات قابل مقایسه ای رسیده است.
اعداد منتشر شده قابل توجه است. در SWE-Bench Pro، Fugu Ultra امتیاز 73.7 را به دست آورد، بالاتر از Opus 4.8 با 69.2، Gemini 3.1 Pro با 54.2 و GPT 5.5 با 58.6. در TerminalBench 2.1 امتیاز 80.2 را در مقابل Opus 4.8 82.1 کسب کرد. در LiveCodeBench به 93.2 در برابر 85.3 GPT 5.5 رسید و در Humanity's Last Exam به 50.0 رسید که بالاتر از Opus 4.8 49.8 و GPT 5.5 41.4 است.
تست های دنیای واقعی یک تصویر ترکیبی را نقاشی می کنند
بررسی های عملی اولیه نسبت به معیارها مشتاق کمتری بوده است. محقق هوش مصنوعی Ethan Mollick در X نوشت که Fugu Ultra "بسیار آهسته" است، آزمایشهای کدگذاری معمول او 30 دقیقه طول میکشد و نتایجی که "خوب" بودند، اما در عمل از Fable کوتاه بودند. کاربر دیگری گزارش داد که با یک اخطار یک سهمیه 5 ساعته را در طرح 20 دلاری انجام داده است، در حالی که توسعه دهندگان در Hacker News شکایت داشتند که طرح 200 دلاری در ماه کمتر از سه ساعت در هفته زمان قابل استفاده را به همراه دارد.
بررسی کد به عنوان یک نقطه روشن ظاهر شد و تقریباً از نظر کیفیت با Opus 4.8 یا GPT 5.5 مطابقت داشت. یک آزمایش سر به سر نشان داد که Fugu Ultra یک کار کدنویسی را در 22 دقیقه با قیمت 7.32 دلار به پایان رساند، بسیار سریعتر و ارزانتر از Opus 4.8 با 79 دقیقه و 37.85 دلار، اگرچه بازبین خروجی Opus را ترجیح داد.
هوش مصنوعی ساکانا، که در سال 2023 در توکیو تأسیس شد و توسط انویدیا پشتیبانی میشود، هویت خود را بر اساس تحقیقات هوش مصنوعی الهام گرفته از طبیعت، با استفاده از الگوریتمهای تکاملی و ایدههای هوش جمعی برای فشرده کردن عملکرد بیشتر از مدلهای موجود، ساخته است. فوگو این فلسفه را به بازار تجاری گسترش می دهد و خود ارکستراسیون را به یک محصول تبدیل می کند. این شرکت همچنین با یک سایت دوزبانه و قیمت گذاری برای توسعه دهندگان فردی و تیم های سازمانی، این سیستم را برای مخاطبان ژاپنی که نگران اتکای بیش از حد به ارائه دهندگان ایالات متحده هستند، قرار می دهد.
محافظت در برابر قفل فروشنده
فراتر از عملکرد خام، هوش مصنوعی Sakana Fugu را به عنوان محافظی در برابر وابستگی به هر ارائهدهنده هوش مصنوعی معرفی میکند. این شرکت به کنترلهای اخیر صادرات ایالات متحده اشاره کرد که مدلهای افسانه و میتوس آنتروپیک را از بازارهای خارجی خارج کرد تا دلیلی بر این باشد که دسترسی به سیستمهای برتر میتواند یک شبه ناپدید شود.
Sakana AI در اطلاعیه خود نوشت: «برای یک سازمان یا یک ملت، تکیه بر APIهای یک شرکت برای زیرساختهای حیاتی، مالی یا حاکمیت یک آسیبپذیری مادی است. از آنجایی که استخر مدل Fugu کاملاً قابل تعویض است، اگر یکی از ارائهدهندگان تاریک شود، سیستم میتواند به مدلهای دیگر تغییر مسیر دهد.
تحلیلگران هشدار می دهند که این همان حاکمیت واقعی نیست. عملکرد Fugu بستگی به مدلهایی دارد که در استخر آن قرار میگیرند، و چندین ارائهدهنده برتر که دسترسی را به یکباره محدود میکنند همچنان گزینههای آن را کوچک میکنند. این شرکت همچنین هنوز فاش نکرده است که لایه ارکستراسیون چقدر استفاده و هزینه توکن را افزایش می دهد. با این حال، همانطور که مدلهای مرزی به داراییهای ژئوپلیتیکی تبدیل میشوند و قفل تک فروشنده پرخطرتر میشود، Fugu پیشنمایش صنعت هوش مصنوعی را ارائه میدهد که در آن هماهنگی ممکن است به اندازه توانایی مهم باشد.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



