Sakana AI yang berpangkalan di Tokyo telah melancarkan Fugu, sebuah sistem yang menyampaikan prestasi model AI sempadan dengan menyelaraskan banyak model secara dinamik serentak. Daripada membina satu rangkaian saraf gergasi, Fugu sendiri merupakan model bahasa yang dilatih untuk memanggil LLM lain daripada "kolam ejen" yang boleh ditukar, memasang satu pasukan model khusus untuk setiap tugas dan mensintesis output mereka melalui API tunggal yang serasi OpenAI.
Pelancaran, yang diliputi oleh THE DECODER, MarkTechPost, dan MIT Sloan Management Review, mewakili pertaruhan bahawa lonjakan seterusnya dalam prestasi AI mungkin kurang daripada skala mentah dan lebih daripada penyelarasan yang lebih bijak bagi model yang sudah wujud. For more context on this story, see our ongoing AI industry coverage.
Satu Model untuk Memerintahkan Mereka Semua
Bagi pengguna, Fugu berkelakuan seperti model tunggal. Di bawah tudung, ia sama ada mengendalikan permintaan sendiri atau mengumpulkan satu pasukan model khusus, mengurus pemilihan, perwakilan, penyemakan dan sintesis secara dalaman. Sakana AI berkata pendekatan itu dibina berdasarkan kerja terdahulu seperti ALE-Agentnya, yang meletakkan tempat ke-21 daripada 1,000 pakar manusia dalam pertandingan pengekodan menggunakan teknik orkestrasi.
Syarikat itu mengeluarkan dua varian. Model Fugu asas menyasarkan kependaman rendah dan prestasi harian yang kukuh merentas pengekodan, semakan kod dan kes penggunaan chatbot, dan membolehkan pasukan mengecualikan ejen tertentu daripada kumpulan untuk privasi atau pematuhan. Fugu Ultra dibina untuk kualiti jawapan maksimum pada masalah kompleks berbilang langkah seperti menghasilkan semula kertas saintifik, analisis keselamatan siber dan carian paten dan literatur.
Tuntutan Penanda Aras Yang Menoleh
Menurut hasil penanda aras Sakana AI yang diterbitkan, Fugu Ultra menunjukkan prestasi setanding dengan Anthropic's Fable 5 dan Mythos Preview merentas julat pengekodan, penaakulan dan penanda aras sains. Terutamanya, kedua-dua model Anthropic sebenarnya tidak berada dalam kumpulan ejen Fugu kerana ia tidak tersedia secara umum, bermakna Fugu mencapai skor yang setanding menggunakan model lain.
Nombor yang diterbitkan sangat menarik. Pada SWE-Bench Pro, Fugu Ultra mendapat 73.7, mendahului Opus 4.8 pada 69.2, Gemini 3.1 Pro pada 54.2 dan GPT 5.5 pada 58.6. Pada TerminalBench 2.1 ia mendapat 80.2 berbanding 82.1 Opus 4.8. Pada LiveCodeBench ia mencapai 93.2 berbanding 85.3 GPT 5.5, dan pada Peperiksaan Terakhir Kemanusiaan ia mencatatkan 50.0, mengatasi 49.8 Opus 4.8 dan 41.4 GPT 5.5.
Ujian Dunia Sebenar Melukis Gambar Bercampur
Ulasan amali awal kurang bersemangat berbanding penanda aras. Penyelidik AI, Ethan Mollick menulis di X bahawa Fugu Ultra adalah "sangat perlahan", dengan ujian pengekodannya yang biasa mengambil masa 30 minit dan keputusan yang "baik" tetapi tidak sesuai dengan Fable dalam amalan. Pengguna lain melaporkan meniup keseluruhan kuota lima jam pada pelan $20 dengan satu gesaan, manakala pembangun di Hacker News mengadu bahawa pelan $200 sebulan menghasilkan kurang daripada tiga jam seminggu masa yang boleh digunakan.
Ulasan kod muncul sebagai titik terang, kira-kira sepadan dengan kualiti Opus 4.8 atau GPT 5.5. Satu ujian head-to-head menunjukkan Fugu Ultra menyelesaikan tugas pengekodan dalam 22 minit dengan harga $7.32, jauh lebih pantas dan lebih murah daripada Opus 4.8 79 minit dan $37.85, walaupun pengulas memilih output Opus.
Sakana AI, yang diasaskan di Tokyo pada 2023 dan disokong oleh Nvidia, telah membina identitinya pada penyelidikan AI yang diilhamkan oleh alam semula jadi, menggunakan algoritma evolusi dan idea kecerdasan kolektif untuk memerah lebih banyak prestasi daripada model sedia ada. Fugu meluaskan falsafah itu ke pasaran komersial, menjadikan orkestrasi itu sendiri sebagai produk. Syarikat itu juga meletakkan sistem untuk khalayak Jepun yang bimbang tentang terlalu bergantung pada pembekal A.S., dengan tapak dwibahasa dan harga yang ditujukan kepada pembangun individu dan pasukan perusahaan.
Lindung Nilai Terhadap Penguncian Vendor
Di luar prestasi mentah, Sakana AI meletakkan Fugu sebagai perlindungan terhadap pergantungan pada mana-mana pembekal AI tunggal. Syarikat itu menunjukkan kawalan eksport A.S. baru-baru ini yang menarik model Anthropic's Fable dan Mythos daripada pasaran asing sebagai bukti bahawa akses kepada sistem teratas boleh hilang dalam sekelip mata.
"Bagi organisasi atau negara, bergantung pada API syarikat tunggal untuk infrastruktur kritikal, kewangan atau tadbir urus adalah kelemahan material," tulis Sakana AI dalam pengumumannya. Oleh kerana kumpulan model Fugu boleh ditukar sepenuhnya, sistem boleh mengubah hala ke model lain jika satu pembekal menjadi gelap.
Penganalisis mengingatkan bahawa ini tidak sama dengan kedaulatan sebenar. Prestasi Fugu bergantung pada model yang terdapat dalam kumpulannya, dan beberapa penyedia teratas yang mengehadkan akses sekaligus masih akan mengecilkan pilihannya. Syarikat itu juga belum mendedahkan berapa banyak lapisan orkestrasi memacu penggunaan dan kos token. Namun, memandangkan model sempadan menjadi aset geopolitik dan sekatan masuk vendor tunggal menjadi lebih berisiko, Fugu menawarkan pratonton industri AI di mana penyelarasan mungkin penting seperti keupayaan.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



