Het in Tokio gevestigde Sakana AI heeft Fugu gelanceerd, een systeem dat de prestaties levert van een grensverleggend AI-model door veel modellen tegelijk dynamisch te coördineren. In plaats van één gigantisch neuraal netwerk te bouwen, is Fugu zelf een taalmodel dat is getraind om andere LLM's aan te roepen vanuit een verwisselbare 'agentpool', waarbij voor elke taak een team van gespecialiseerde modellen wordt samengesteld en hun output wordt gesynthetiseerd via een enkele OpenAI-compatibele API.
De lancering, besproken door THE DECODER, MarkTechPost en MIT Sloan Management Review, vertegenwoordigt een gok dat de volgende sprong in AI-prestaties minder voortkomt uit ruwe schaal en meer uit een slimmere coördinatie van de reeds bestaande modellen. Voor meer context over dit verhaal, zie ons AI-nieuws.
Eén model om ze allemaal te besturen
Voor de gebruiker gedraagt Fugu zich als één model. Onder de motorkap handelt het zelf een verzoek af, of brengt het een team van gespecialiseerde modellen samen, dat de selectie, delegatie, controle en synthese intern beheert. Sakana AI zegt dat de aanpak voortbouwt op eerder werk, zoals zijn ALE-Agent, die de 21e van de 1.000 menselijke experts plaatste in een codeerwedstrijd met behulp van orkestratietechnieken.
Het bedrijf brengt twee varianten uit. Het basismodel van Fugu is gericht op lage latentie en solide dagelijkse prestaties op het gebied van codering, codebeoordeling en gebruik van chatbots, en laat teams specifieke agenten uitsluiten van de pool vanwege privacy of compliance. Fugu Ultra is gebouwd voor maximale antwoordkwaliteit bij complexe problemen die uit meerdere stappen bestaan, zoals het reproduceren van wetenschappelijke artikelen, cyberbeveiligingsanalyses en zoeken naar patenten en literatuur.
Benchmarkclaims die de aandacht trekken
Volgens de benchmarkresultaten die Sakana AI heeft gepubliceerd, presteert Fugu Ultra vergelijkbaar met Anthropic's Fable 5 en Mythos Preview op een reeks codeer-, redeneer- en wetenschappelijke benchmarks. Opvallend is dat geen van beide Anthropic-modellen daadwerkelijk in de agentenpool van Fugu zit, omdat ze niet openbaar beschikbaar zijn, wat betekent dat Fugu vergelijkbare scores behaalde met andere modellen.
De gepubliceerde cijfers zijn opvallend. Op SWE-Bench Pro scoorde Fugu Ultra 73,7, vóór Opus 4.8 met 69,2, Gemini 3.1 Pro met 54,2 en GPT 5,5 met 58,6. Op TerminalBench 2.1 scoorde het 80,2 versus Opus 4.8's 82,1. Op LiveCodeBench bereikte het een score van 93,2 tegen een score van 85,3 van GPT 5.5, en op Humanity's Last Exam noteerde het een score van 50,0, waarmee het de 49,8 van Opus 4.8 en de 41,4 van GPT 5.5 overtrof.
Tests uit de echte wereld schetsen een gemengd beeld
De eerste praktijkgerichte recensies waren minder enthousiast dan de benchmarks. AI-onderzoeker Ethan Mollick schreef op X dat Fugu Ultra "ongelooflijk traag" is, waarbij zijn gebruikelijke coderingstests 30 minuten duurden en de resultaten "prima" waren, maar in de praktijk achterbleven bij Fable. Een andere gebruiker meldde dat hij met één enkele prompt een volledig quotum van vijf uur voor het $ 20-abonnement had overschreden, terwijl ontwikkelaars op Hacker News klaagden dat het $ 200-per-maand-abonnement minder dan drie uur per week bruikbare tijd oplevert.
Coderecensies kwamen naar voren als een lichtpuntje en kwamen qua kwaliteit ongeveer overeen met Opus 4.8 of GPT 5.5. Uit één onderlinge test bleek dat Fugu Ultra een codeeropdracht in 22 minuten voltooide voor $ 7,32, veel sneller en goedkoper dan de 79 minuten en $ 37,85 van Opus 4.8, hoewel de recensent de voorkeur gaf aan de output van Opus.
Sakana AI, opgericht in Tokio in 2023 en ondersteund door Nvidia, heeft zijn identiteit gebouwd op door de natuur geïnspireerd AI-onderzoek, waarbij gebruik wordt gemaakt van evolutionaire algoritmen en collectieve intelligentie-ideeën om meer prestaties uit bestaande modellen te halen. Fugu breidt die filosofie uit naar de commerciële markt en maakt van orkestratie zelf een product. Het bedrijf positioneert het systeem ook voor een Japans publiek dat bang is voor een te grote afhankelijkheid van Amerikaanse providers, met een tweetalige site en prijzen gericht op zowel individuele ontwikkelaars als bedrijfsteams.
Een bescherming tegen leverancierslock-in
Naast pure prestaties presenteert Sakana AI Fugu als een bescherming tegen de afhankelijkheid van een enkele AI-provider. Het bedrijf wees op recente Amerikaanse exportcontroles die de Fable- en Mythos-modellen van Anthropic van buitenlandse markten haalden als bewijs dat de toegang tot topsystemen van de ene op de andere dag kan verdwijnen.
“Voor een organisatie of een land is het vertrouwen op de API’s van één bedrijf voor kritieke infrastructuur, financiën of bestuur een materiële kwetsbaarheid”, schreef Sakana AI in zijn aankondiging. Omdat de modellenpool van Fugu volledig uitwisselbaar is, kan het systeem omleiden naar andere modellen als een provider uitvalt.
Analisten waarschuwen dat dit niet hetzelfde is als echte soevereiniteit. De prestaties van Fugu zijn afhankelijk van welke modellen er in de pool zitten, en verschillende topproviders die de toegang in één keer beperken, zouden de opties nog steeds verkleinen. Het bedrijf heeft ook nog niet bekendgemaakt hoeveel de orkestratielaag het tokengebruik en de kosten opdrijft. Maar nu frontiermodellen geopolitieke troeven worden en de lock-in van één leverancier steeds riskanter wordt, biedt Fugu een voorproefje van een AI-industrie waar coördinatie net zo belangrijk kan zijn als capaciteit.
---
Blijf Voorop met AIHet laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.
Lees meer AI-nieuws →



