Токійська компанія Sakana AI запустила Fugu, систему, яка забезпечує продуктивність передової моделі ШІ шляхом динамічної координації багатьох моделей одночасно. Замість того, щоб будувати одну гігантську нейронну мережу, Fugu сама по собі є мовною моделлю, навченою викликати інші LLM із змінного «пулу агентів», збираючи команду спеціалізованих моделей для кожного завдання та синтезуючи їхні результати через єдиний API, сумісний з OpenAI.

Запуск, який висвітлювали THE DECODER, MarkTechPost і MIT Sloan Management Review, свідчить про те, що наступний стрибок у продуктивності штучного інтелекту може статися не за рахунок грубого масштабу, а більше за рахунок розумнішої координації моделей, які вже існують. For more context on this story, see our ongoing latest AI developments.

Одна модель, щоб керувати ними всіма

Для користувача Fugu поводиться як єдина модель. Під капотом він або обробляє запити самостійно, або об’єднує команду спеціалізованих моделей, керуючи вибором, делегуванням, перевіркою та внутрішнім синтезом. Sakana AI каже, що цей підхід ґрунтується на попередніх роботах, таких як його ALE-Agent, який посів 21 місце з 1000 експертів-людей у ​​змаганні з кодування з використанням техніки оркестровки.

Компанія випускає два варіанти. Базова модель Fugu націлена на низьку затримку та надійну повсякденну продуктивність у сценаріях кодування, перегляду коду та використання чат-ботів, а також дозволяє командам виключати певних агентів із пулу для конфіденційності чи відповідності. Fugu Ultra створено для максимальної якості відповідей на складні багатоетапні проблеми, такі як відтворення наукових статей, аналіз кібербезпеки, пошук патентів і літератури.

Порівняльні дані, які привертають увагу

Відповідно до результатів тестування, опублікованих Sakana AI, Fugu Ultra працює нарівні з Fable 5 і Mythos Preview від Anthropic у ряді тестів кодування, міркування та наукових тестів. Примітно, що жодна з моделей Anthropic фактично не входить до складу агентів Fugu, оскільки вони не є загальнодоступними, тобто Fugu досягла порівнянних результатів, використовуючи інші моделі.

Опубліковані цифри вражають. На SWE-Bench Pro Fugu Ultra отримав 73,7, випереджаючи Opus 4.8 з 69,2, Gemini 3.1 Pro з 54,2 і GPT 5,5 з 58,6. На TerminalBench 2.1 він набрав 80,2 проти 82,1 Opus 4.8. На LiveCodeBench він досяг 93,2 проти 85,3 у GPT 5.5, а на Останньому іспиті Humanity опублікував 50,0, перевищивши 49,8 у Opus 4.8 і 41,4 у GPT 5.5.

Реальні тести малюють неоднозначну картину

Перші практичні огляди викликали менший ентузіазм, ніж тести. Дослідник штучного інтелекту Ітан Моллік написав на X, що Fugu Ultra «неймовірно повільний», його звичайні тести кодування тривали 30 хвилин і результати були «хорошими», але на практиці не поступалися Fable. Інший користувач повідомив, що витратив цілу п’ятигодинну квоту за планом у 20 доларів за один запит, тоді як розробники на Hacker News скаржилися, що план у 200 доларів на місяць дає менше трьох годин на тиждень корисного часу.

Огляд коду став яскравою плямою, приблизно відповідаючи за якістю Opus 4.8 або GPT 5.5. Один прямий тест показав, що Fugu Ultra завершує завдання кодування за 22 хвилини за $7,32, набагато швидше і дешевше, ніж Opus 4.8 за 79 хвилин і $37,85, хоча рецензент віддав перевагу результату Opus.

Компанія Sakana AI, заснована в Токіо в 2023 році за підтримки Nvidia, побудувала свою ідентичність на основі досліджень штучного інтелекту, натхненних природою, використовуючи еволюційні алгоритми та ідеї колективного інтелекту, щоб отримати більше продуктивності від існуючих моделей. Fugu поширює цю філософію на комерційний ринок, перетворюючи саму оркестровку на продукт. Компанія також позиціонує систему для японської аудиторії, яка стурбована надмірною залежністю від американських провайдерів, з двомовним сайтом і цінами, орієнтованими як на окремих розробників, так і на корпоративні команди.

Захист від блокування постачальника

Крім простої продуктивності, Sakana AI пропонує Fugu як гарантію від залежності від будь-якого окремого постачальника штучного інтелекту. Компанія вказала на нещодавній експортний контроль США, який вилучив моделі Anthropic Fable і Mythos із зовнішніх ринків, як доказ того, що доступ до найкращих систем може зникнути миттєво.

«Для організації чи нації покладатися на API однієї компанії для критичної інфраструктури, фінансів або управління є суттєвою вразливістю», — написав Sakana AI у своєму повідомленні. Оскільки пул моделей Fugu повністю замінюється, система може перенаправляти на інші моделі, якщо один провайдер перестає працювати.

Аналітики застерігають, що це не те саме, що справжній суверенітет. Продуктивність Fugu залежить від того, які моделі знаходяться в його пулі, і кілька провідних провайдерів, які обмежують доступ одночасно, все одно зменшать його можливості. Компанія також ще не розкрила, наскільки рівень оркестровки збільшує використання та вартість токенів. Тим не менш, оскільки передові моделі стають геополітичними активами, а прив’язка до одного постачальника стає все більш ризикованою, Fugu пропонує попередній перегляд індустрії ШІ, де координація може мати таке ж значення, як і можливості.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →