总部位于东京的 Sakana AI 推出了 Fugu,这是一个通过同时动态协调多个模型来提供前沿人工智能模型性能的系统。 Fugu 本身并不是构建一个巨大的神经网络,而是一种语言模型,经过训练可以从可交换的“代理池”中调用其他法学硕士,为每个任务组装一组专门的模型,并通过单个 OpenAI 兼容的 API 合成它们的输出。
THE DECODER、MarkTechPost 和《麻省理工斯隆管理评论》对此次发布进行了报道,它代表着一种押注:人工智能性能的下一次飞跃可能更多地来自于现有模型的更智能协调,而不是原始规模。 更多相关背景,请参阅我们的人工智能资讯。
一种模型统领所有
对于用户来说,Fugu 的行为就像一个单一的模型。在底层,它要么自行处理请求,要么汇集一组专门的模型,在内部管理选择、委托、检查和综合。 Sakana AI 表示,该方法建立在 ALE-Agent 等早期工作的基础上,该项目使用编排技术在编码竞赛中从 1000 名人类专家中获得了第 21 名。
该公司正在发布两种版本。 Fugu 基本模型的目标是在编码、代码审查和聊天机器人用例中实现低延迟和稳定的日常性能,并允许团队从池中排除特定代理以保护隐私或合规性。 Fugu Ultra 专为复杂、多步骤问题(例如复制科学论文、网络安全分析以及专利和文献检索)提供最高质量的答案而构建。
引人注目的基准声明
根据 Sakana AI 发布的基准测试结果,Fugu Ultra 在一系列编码、推理和科学基准测试中的表现与 Anthropic 的 Fable 5 和 Mythos Preview 相当。值得注意的是,这两个 Anthropic 模型实际上都不在 Fugu 的代理池中,因为它们不公开,这意味着 Fugu 使用其他模型达到了可比的分数。
公布的数字令人震惊。在 SWE-Bench Pro 上,Fugu Ultra 得分为 73.7,领先于 Opus 4.8(69.2)、Gemini 3.1 Pro(54.2)和 GPT 5.5(58.6)。在 TerminalBench 2.1 上,它的得分为 80.2,而 Opus 4.8 的得分为 82.1。在 LiveCodeBench 上,它达到了 93.2,而 GPT 5.5 的得分为 85.3,在 Humanity 的最后考试中,它的得分为 50.0,超过了 Opus 4.8 的 49.8 分和 GPT 5.5 的 41.4 分。
真实世界的测试描绘出一幅复杂的图景
早期的实践评估不如基准测试那么热情。 AI 研究员 Ethan Mollick 在 X 上写道,Fugu Ultra 的速度“极其缓慢”,他通常的编码测试需要 30 分钟,结果“很好”,但在实践中却达不到《神鬼寓言》的水平。另一位用户报告称,只需一个提示就用完了 20 美元计划的整个 5 小时配额,而 Hacker News 的开发人员则抱怨说,每月 200 美元的计划每周的可用时间不足三个小时。
代码审查成为一个亮点,其质量大致与 Opus 4.8 或 GPT 5.5 相当。一项头对头测试显示,Fugu Ultra 在 22 分钟内以 7.32 美元的价格完成了一项编码任务,比 Opus 4.8 的 79 分钟和 37.85 美元更快、更便宜,尽管评论者更喜欢 Opus 的输出。
Sakana AI 于 2023 年在东京成立,得到了 Nvidia 的支持,其品牌建立在受自然启发的人工智能研究之上,利用进化算法和集体智慧思想从现有模型中榨取更多性能。 Fugu 将这种理念延伸到商业市场,将编排本身变成了一种产品。该公司还为担心过度依赖美国提供商的日本受众定位该系统,并提供双语网站和针对个人开发商和企业团队的定价。
针对供应商锁定的对冲
除了原始性能之外,Sakana AI 还将 Fugu 视为避免依赖任何单一人工智能提供商的保障措施。该公司指出,美国最近实施的出口管制将 Anthropic 的 Fable 和 Mythos 模型从国外市场撤出,这证明对顶级系统的访问可能会在一夜之间消失。
Sakana AI 在其声明中写道:“对于一个组织或国家来说,依赖一家公司的 API 来实现关键基础设施、财务或治理是一个重大漏洞。”由于 Fugu 的模型池是完全可交换的,因此如果一个提供商出现故障,系统可以重新路由到其他模型。
分析人士警告说,这并不等同于真正的主权。 Fugu 的性能取决于其池中的型号,并且立即限制访问的几家顶级提供商仍会缩小其选择范围。该公司还没有透露编排层对代币使用和成本的影响有多大。尽管如此,随着前沿模型成为地缘政治资产以及单一供应商锁定的风险变得越来越大,Fugu 提供了人工智能行业的预览,在该行业中,协调可能与能力一样重要。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →



