Tokyo-baserade Sakana AI har lanserat Fugu, ett system som ger prestandan hos en frontier AI-modell genom att dynamiskt koordinera många modeller samtidigt. Istället för att bygga ett gigantiskt neuralt nätverk, är Fugu själv en språkmodell som tränats för att anropa andra LLM:er från en utbytbar "agentpool", som sätter ihop ett team av specialiserade modeller för varje uppgift och syntetiserar deras utdata genom ett enda OpenAI-kompatibelt API.
Lanseringen, som täcks av THE DECODER, MarkTechPost och MIT Sloan Management Review, representerar en satsning på att nästa steg i AI-prestanda kan komma mindre från råskala och mer från smartare koordinering av de modeller som redan finns. For more context on this story, see our ongoing AI industry coverage.
En modell för att styra dem alla
För användaren beter sig Fugu som en enda modell. Under huven hanterar den antingen en förfrågan på egen hand eller drar ihop ett team av specialiserade modeller, hanterar urval, delegering, kontroll och syntes internt. Sakana AI säger att tillvägagångssättet bygger på tidigare arbete som dess ALE-Agent, som placerade sig på plats 21 av 1 000 mänskliga experter i en kodningstävling med hjälp av orkestreringstekniker.
Företaget släpper två varianter. Basmodellen av Fugu är inriktad på låg latens och stabil vardaglig prestanda över kodning, kodgranskning och användning av chatbot, och låter team utesluta specifika agenter från poolen för integritet eller efterlevnad. Fugu Ultra är byggd för maximal svarskvalitet på komplexa problem i flera steg, såsom reproducering av vetenskapliga artiklar, cybersäkerhetsanalys och patent- och litteratursökningar.
Benchmark-påståenden som vänder huvudena
Enligt riktmärkeresultat som Sakana AI publicerade, presterar Fugu Ultra i nivå med Anthropics Fable 5 och Mythos Preview över en rad riktmärken för kodning, resonemang och vetenskap. Noterbart är att ingen av de antropiska modellerna faktiskt finns i Fugus agentpool eftersom de inte är offentligt tillgängliga, vilket betyder att Fugu nådde jämförbara poäng med andra modeller.
De publicerade siffrorna är slående. På SWE-Bench Pro fick Fugu Ultra 73,7, före Opus 4,8 på 69,2, Gemini 3,1 Pro på 54,2 och GPT 5,5 på 58,6. På TerminalBench 2.1 fick den 80,2 mot Opus 4.8:s 82,1. På LiveCodeBench nådde den 93,2 mot GPT 5.5:s 85.3, och på Humanity's Last Exam fick den 50.0, vilket toppade Opus 4.8:s 49.8 och GPT 5.5:s 41,4.
Real-World Tests Måla en blandad bild
Tidiga praktiska recensioner har varit mindre entusiastiska än riktmärkena. AI-forskaren Ethan Mollick skrev på X att Fugu Ultra är "otroligt långsam", med sina vanliga kodningstester som tar 30 minuter och resultat som var "bra" men som inte var Fable i praktiken. En annan användare rapporterade att han blåste igenom en hel femtimmarskvot på $20-planen med en enda uppmaning, medan utvecklare på Hacker News klagade på att $200-per-månad-planen ger mindre än tre timmar i veckan användbar tid.
Kodrecensioner dök upp som en ljuspunkt och matchade ungefär Opus 4.8 eller GPT 5.5 i kvalitet. Ett head-to-head-test visade att Fugu Ultra slutförde en kodningsuppgift på 22 minuter för $7,32, mycket snabbare och billigare än Opus 4.8:s 79 minuter och $37,85, även om recensenten föredrog Opus produktion.
Sakana AI, som grundades i Tokyo 2023 och stöds av Nvidia, har byggt sin identitet på naturinspirerad AI-forskning, med hjälp av evolutionära algoritmer och kollektiva intelligensidéer för att pressa mer prestanda från befintliga modeller. Fugu utvidgar den filosofin till den kommersiella marknaden och förvandlar själva orkestreringen till en produkt. Företaget positionerar också systemet för en japansk publik som är orolig för övertilliten till amerikanska leverantörer, med en tvåspråkig webbplats och prissättning riktad till både enskilda utvecklare och företagsteam.
En säkring mot leverantörslåsning
Utöver den råa prestandan, presenterar Sakana AI Fugu som ett skydd mot beroende av någon enskild AI-leverantör. Företaget pekade på senaste amerikanska exportkontroller som drog Anthropics Fable och Mythos-modeller från utländska marknader som bevis på att tillgången till toppsystem kan försvinna över en natt.
"För en organisation eller en nation är det en väsentlig sårbarhet att förlita sig på ett enda företags API:er för kritisk infrastruktur, ekonomi eller styrning", skrev Sakana AI i sitt tillkännagivande. Eftersom Fugus modellpool är fullt utbytbar kan systemet omdirigera till andra modeller om en leverantör blir mörk.
Analytiker varnar för att detta inte är detsamma som sann suveränitet. Fugus prestanda beror på vilka modeller som sitter i poolen, och flera toppleverantörer som begränsar åtkomsten samtidigt skulle fortfarande minska dess alternativ. Företaget har ännu inte avslöjat hur mycket orkestreringsskiktet driver upp tokenanvändning och kostnad. Ändå, när gränsmodeller blir geopolitiska tillgångar och inlåsning av en leverantör blir mer riskabel, erbjuder Fugu en förhandstitt på en AI-industri där koordination kan ha lika stor betydelse som förmåga.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



