東京を拠点とするSakana AIは、多くのモデルを一度に動的に調整することでフロンティアAIモデルのパフォーマンスを実現するシステム「Fugu」を立ち上げた。 Fugu は、1 つの巨大なニューラル ネットワークを構築するのではなく、それ自体が交換可能な「エージェント プール」から他の LLM を呼び出すようにトレーニングされた言語モデルであり、各タスクに特化したモデルのチームを編成し、単一の OpenAI 互換 API を通じて出力を合成します。
THE DECODER、MarkTechPost、MIT Sloan Management Review が取り上げたこの発表は、AI パフォーマンスの次の飛躍は、生のスケールからではなく、既存のモデルのよりスマートな調整によってもたらされる可能性があるという賭けを表しています。 この件の詳細は、人工知能の最新情報をご覧ください。
1 つのモデルですべてを指揮できる
ユーザーにとって、Fugu は単一のモデルのように動作します。内部では、リクエストを独自に処理するか、特化したモデルのチームをまとめて、内部で選択、委任、チェック、合成を管理します。 Sakana AI によれば、このアプローチは、オーケストレーション技術を使用したコーディング コンテストで人間の専門家 1,000 人中 21 位に入賞した ALE-Agent などの以前の成果に基づいているという。
同社は 2 つのバリエーションをリリースしています。 Fugu の基本モデルは、コーディング、コード レビュー、チャットボットのユースケース全体で低遅延と安定した日常パフォーマンスをターゲットにしており、チームはプライバシーやコンプライアンスの観点から特定のエージェントをプールから除外できます。 Fugu Ultra は、科学論文の再現、サイバーセキュリティ分析、特許や文献の検索など、複雑で複数のステップからなる問題に対して最高の回答品質を提供できるように構築されています。
注目を集めるベンチマークの主張
Sakana AI が公開したベンチマーク結果によると、Fugu Ultra は、コーディング、推論、科学ベンチマークの範囲にわたって、Anthropic の Fable 5 や Mythos Preview と同等のパフォーマンスを発揮します。特に、Anthropic モデルはどちらも一般公開されていないため、実際には Fugu のエージェント プールに含まれていません。これは、Fugu が他のモデルを使用して同等のスコアに到達したことを意味します。
公表された数字は驚くべきものです。 SWE-Bench Pro では、Fugu Ultra のスコアは 73.7 で、Opus 4.8 の 69.2、Gemini 3.1 Pro の 54.2、GPT 5.5 の 58.6 を上回りました。 TerminalBench 2.1 では 80.2 点でしたが、Opus 4.8 では 82.1 点でした。 LiveCodeBench では GPT 5.5 の 85.3 に対して 93.2 に達し、人類最後の試験では 50.0 を記録し、Opus 4.8 の 49.8 と GPT 5.5 の 41.4 を上回りました。
現実世界のテストではさまざまな状況が描かれます
初期の実践レビューは、ベンチマークほど熱心ではありませんでした。 AI 研究者のイーサン・モリック氏は、Fugu Ultra は「信じられないほど遅い」と X に書き、通常のコーディング テストには 30 分かかり、結果は「問題ない」ものの、実際には Fable には及ばなかったと述べています。別のユーザーは、20 ドルのプランの 5 時間の割り当てを 1 回のプロンプトで使い果たしたと報告しましたが、Hacker News の開発者たちは、月額 200 ドルのプランでは使用できる時間が 1 週間に 3 時間未満であると不満を述べています。
コードレビューは明るい話題として浮上し、品質では Opus 4.8 または GPT 5.5 とほぼ同等でした。ある直接テストでは、Fugu Ultra が 7.32 ドルでコーディング タスクを 22 分で完了することが示されました。これは、Opus 4.8 の 79 分と 37.85 ドルよりもはるかに高速かつ安価ですが、レビュアーは Opus の出力を好みました。
2023 年に東京で設立され、Nvidia の支援を受けている Sakana AI は、自然からインスピレーションを得た AI 研究に基づいてアイデンティティを構築し、進化的アルゴリズムと集合知のアイデアを使用して既存のモデルからより多くのパフォーマンスを絞り出しました。 Fugu はその哲学を商業市場に拡張し、オーケストレーション自体を製品に変えます。同社はまた、個人の開発者と企業チームの両方を対象としたバイリンガルのサイトと価格設定により、米国のプロバイダーへの過度の依存を懸念する日本の視聴者向けにこのシステムを位置づけています。
ベンダーロックインに対するヘッジ
本来のパフォーマンスを超えて、Sakana AI は単一の AI プロバイダーへの依存に対する安全策として Fugu を売り込んでいます。同社は、最上位システムへのアクセスが一夜にして失われる可能性があることの証拠として、Anthropic の Fable モデルと Mythos モデルを海外市場から撤去した最近の米国の輸出規制を挙げました。
「組織や国家にとって、重要なインフラ、財務、ガバナンスを一社のAPIに依存することは重大な脆弱性である」とSakana AIは発表文で述べている。 Fugu のモデル プールは完全にスワップ可能なため、1 つのプロバイダーが停止した場合、システムは他のモデルに再ルーティングできます。
アナリストらは、これは真の主権とは異なると警告している。 Fugu のパフォーマンスは、そのプールにどのモデルが含まれるかによって決まります。また、複数のトッププロバイダーが一度にアクセスを制限すると、選択肢は依然として狭まってしまいます。同社はまた、オーケストレーション層がトークンの使用量とコストをどの程度増加させるかについてもまだ明らかにしていない。それでも、フロンティアモデルが地政学的な資産となり、単一ベンダーのロックインのリスクが高まる中、Fugu は、能力と同じくらい調整が重要になる可能性がある AI 業界のプレビューを提供します。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →



