Tokyo merkezli Sakana AI, birçok modeli aynı anda dinamik olarak koordine ederek öncü bir AI modelinin performansını sunan bir sistem olan Fugu'yu piyasaya sürdü. Fugu, devasa bir sinir ağı oluşturmak yerine, diğer LLM'leri değiştirilebilir bir "aracı havuzundan" çağırmak, her görev için özel modellerden oluşan bir ekip oluşturmak ve bunların çıktılarını tek bir OpenAI uyumlu API aracılığıyla sentezlemek üzere eğitilmiş bir dil modelidir.
THE DECODER, MarkTechPost ve MIT Sloan Management Review'un kapsadığı lansman, yapay zeka performansındaki bir sonraki sıçramanın ham ölçekten ziyade halihazırda var olan modellerin daha akıllı koordinasyonundan gelebileceğine dair bir iddiayı temsil ediyor. For more context on this story, see our ongoing AI trends.
Hepsine Komut Verecek Tek Model
Kullanıcıya göre Fugu tek bir model gibi davranıyor. Kaputun altında, ya bir talebi kendi başına ele alır ya da özel modellerden oluşan bir ekibi bir araya getirerek seçim, delegasyon, kontrol ve sentezi dahili olarak yönetir. Sakana AI, yaklaşımın, orkestrasyon tekniklerini kullanan bir kodlama yarışmasında 1000 insan uzmandan 21'inci sırada yer alan ALE-Agent gibi daha önceki çalışmalara dayandığını söylüyor.
Şirket iki varyantı piyasaya sürüyor. Temel Fugu modeli, kodlama, kod inceleme ve sohbet robotu kullanım durumlarında düşük gecikmeyi ve sağlam günlük performansı hedefler ve ekiplerin gizlilik veya uyumluluk nedeniyle belirli aracıları havuzdan hariç tutmasına olanak tanır. Fugu Ultra, bilimsel makalelerin çoğaltılması, siber güvenlik analizi, patent ve literatür aramaları gibi karmaşık, çok adımlı sorunlara maksimum yanıt kalitesi sağlamak üzere tasarlanmıştır.
Dikkat Çeken Karşılaştırmalı İddialar
Sakana AI'nın yayınladığı kıyaslama sonuçlarına göre Fugu Ultra, çeşitli kodlama, akıl yürütme ve bilim kıyaslamalarında Anthropic'in Fable 5 ve Mythos Preview'uyla aynı performansı gösteriyor. Dikkat çekici bir şekilde, Antropik modellerin hiçbiri aslında Fugu'nun temsilci havuzunda yer almıyor çünkü bunlar kamuya açık değil, bu da Fugu'nun diğer modelleri kullanarak karşılaştırılabilir puanlara ulaştığı anlamına geliyor.
Yayınlanan rakamlar dikkat çekici. SWE-Bench Pro'da Fugu Ultra 73,7 puan alarak Opus 4,8'i 69,2, Gemini 3.1 Pro'yu 54,2 ve GPT 5,5'i 58,6 puanla geride bıraktı. TerminalBench 2.1'de Opus 4.8'in 82.1'ine karşılık 80.2 puan aldı. LiveCodeBench'te GPT 5.5'in 85.3'üne karşılık 93.2'ye ulaştı ve Humanity's Last Exam'de 50.0 puan alarak Opus 4.8'in 49.8'ini ve GPT 5.5'in 41.4'ünü geride bıraktı.
Gerçek Dünya Testleri Karma Bir Resim Çiziyor
İlk uygulamalı incelemeler, kıyaslamalara göre daha az heyecan vericiydi. Yapay zeka araştırmacısı Ethan Mollick, X'te Fugu Ultra'nın "inanılmaz derecede yavaş" olduğunu, her zamanki kodlama testlerinin 30 dakika sürdüğünü ve sonuçların "iyi" olduğunu ancak pratikte Fable'ın gerisinde kaldığını yazdı. Başka bir kullanıcı, 20 dolarlık planın beş saatlik kotasının tamamını tek bir komutla aştığını bildirdi; Hacker News'teki geliştiriciler ise aylık 200 dolarlık planın haftada üç saatten az kullanılabilir süre sağladığından şikayet etti.
Kod incelemeleri, kalite açısından kabaca Opus 4.8 veya GPT 5.5 ile eşleşen parlak bir nokta olarak ortaya çıktı. Bire bir test, Fugu Ultra'nın bir kodlama görevini 22 dakikada 7,32 dolara tamamladığını gösterdi; bu, Opus 4.8'in 79 dakika ve 37,85 dolardan çok daha hızlı ve daha ucuzdu, ancak incelemeci Opus'un çıktısını tercih etti.
2023 yılında Tokyo'da kurulan ve Nvidia tarafından desteklenen Sakana AI, mevcut modellerden daha fazla performans elde etmek için evrimsel algoritmalar ve kolektif zeka fikirlerini kullanarak kimliğini doğadan ilham alan yapay zeka araştırmaları üzerine inşa etti. Fugu, orkestrasyonun kendisini bir ürüne dönüştürerek bu felsefeyi ticari pazara genişletiyor. Şirket aynı zamanda sistemi, ABD'li sağlayıcılara aşırı güvenme konusunda endişeli olan Japon kitleye yönelik olarak, iki dilli bir site ve hem bireysel geliştiricilere hem de kurumsal ekiplere yönelik fiyatlandırma ile konumlandırıyor.
Satıcı Kilitlenmesine Karşı Bir Koruma
Ham performansın ötesinde Sakana AI, Fugu'yu herhangi bir yapay zeka sağlayıcısına bağımlılığa karşı bir koruma olarak sunuyor. Şirket, Anthropic'in Fable ve Mythos modellerini dış pazarlardan çeken son ABD ihracat kontrollerini, üst düzey sistemlere erişimin bir gecede ortadan kalkabileceğinin kanıtı olarak gösterdi.
Sakana AI, duyurusunda "Bir kuruluş veya ulus için, kritik altyapı, finans veya yönetişim için tek bir şirketin API'lerine güvenmek önemli bir güvenlik açığıdır" diye yazdı. Fugu'nun model havuzu tamamen değiştirilebilir olduğundan, bir sağlayıcının kararması durumunda sistem diğer modellere yeniden yönlendirebilir.
Analistler bunun gerçek egemenlikle aynı şey olmadığı konusunda uyarıyor. Fugu'nun performansı, havuzunda hangi modellerin bulunduğuna bağlıdır ve erişimi aynı anda kısıtlayan birçok üst düzey sağlayıcı yine de seçeneklerini daraltacaktır. Şirket ayrıca düzenleme katmanının token kullanımını ve maliyetini ne kadar artırdığını henüz açıklamadı. Yine de sınır modelleri jeopolitik varlıklar haline geldikçe ve tek satıcıya bağlılık daha riskli hale geldikçe Fugu, koordinasyonun yetenek kadar önemli olabileceği bir yapay zeka endüstrisinin ön izlemesini sunuyor.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



