Fireworks Research 是推理初创公司 Fireworks AI 内部的模型团队,推出了 Ember-1,这是一种专门模型,该公司表示,该模型可产生与 Moonshot AI 的 Kimi K3 相同的答案,同时发出的代币数量减少约 40%。该模型于 9 月 23 日在 Fireworks 平台上上线,在过去的几天里,它已成为开发者社区中讨论最多的版本之一,在 Hacker News 上吸引了数百张投票,因为程序员们争论推理代币是否是下一个成本前沿。

此次推介会正值推理费用(而不是模型能力)越来越多地决定团队能够负担得起的交付能力的时刻。对于关注代理工作负载消耗预算的团队来说,最新的人工智能发展已经明确了一件事:目前业界最昂贵的习惯不是训练前沿模型,而是运行它们。 Ember-1 是 Fireworks 直接解决该问题的尝试,该公司通过一组异常详细的基准和生产数据来支持它。

思维模型想得太多

Ember-1 背后的核心观察是,像 Kimi K3 这样的推理模型将大部分生成的标记(根据 Fireworks 的说法,有时超过 90%)用于内部推理,而不是答案本身。对于单个请求来说,这是昂贵的。在代理工作负载中,它会变得复杂:代理对话的每一轮都会将所有先前的推理重播回模型,因此上下文随着轮数大致呈二次方增长,并且早期轮次的长推理跟踪会在每次后续调用中重新读取和重新计费。

Fireworks 表示,客户告诉他们,他们希望以更低的成本获得 Kimi K3 的编码能力,但简单地拒绝模型的推理工作是行不通的——省力的设置放弃了太多的质量。另一种方法是训练一个模型,该模型可以更有效地推理,同时保留重要的推理。

培训废物处理

根据该公司的博客文章,构建 Ember-1 进行了 50 多次训练实验和 200 多次评估,完全在 Fireworks 自己的无服务器训练平台上运行。该团队表示,他们开发了新的训练算法,可以在不损失准确性的情况下缩短推理时间。

值得注意的是,该公司并没有试图完全消除推理。 Kimi K3 的一些明显的冗长是富有成效的自我反思 - 重新审视假设、响应反馈或将结果追溯到早期决策有助于模型从错误中恢复。训练制度的目的是保持这种能力,同时消除无效的循环。

训练数据涵盖数学、编码、指令遵循、对话、搜索、工具使用和软件工程,涵盖独立问题和扩展的多轮交互。 Fireworks 表示,它只使用了自己的数据,没有使用客户数据。

基准:帕累托边界上或附近

为了说明成本情况,Fireworks 使用 Kimi K3 的公共 API 定价计算了每个基准成本(每百万个未缓存输入令牌 3 美元、每百万个缓存输入令牌 0.30 美元、每百万个输出令牌 15 美元),并在低、高和最大推理工作量下将 Ember-1 与 K3 进行了比较。该公司报告称,在拥有 50 多个测试样本的每个基准测试中,Ember-1 位于或接近帕累托边界,在最大努力下以一小部分成本与 K3 相匹配,并在低努力下严格控制 K3。

据 Fireworks 报道,与 K3 最大努力的标题比较:

|基准|样品| K3(最大努力)|余烬-1 |
|---|---|---|---|
|终端工作台2.1 | 89 | 89 80.9% | 82.0% |
| SWE-bench 已验证 | 500 | 500 93.2% | 92.2% |
| SWE-互动 | 75 | 75 21.3% | 20.0% |
|深SWE 1.1 | 113 | 113 66.4% | 75.2% |
| τ²-长凳航空公司 | 50 | 50 64% | 66% |

在每项任务的成本方面,Fireworks 报告称,与 K3 相比,Ember-1 在 Terminal Bench 2.1 上削减了 51.9% 的开支,在 SWE-Interact 上削减了 32.5%,在 DeepSWE 1.1 上削减了 23.7%,在 SWE-bench Verified 上削减了 15.5% 的开支,就 DeepSWE 而言,按公司计算的费率计算,每单位工作的差异超过 126 美元。

该公司还在 Doximity 的 Bedside Bench 上评估了 Ember-1,这是一个经过医生验证的基准,涉及 10 个专业的 500 个临床病例,Fireworks 通过其新推出的专业情报指数运行该基准。 Fireworks 表示,Ember-1 在开放式和封闭式模型(包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5)的每任务成本上设定了新的帕累托前沿。这一说法来自 Fireworks 自己的指数,尚未经过独立验证。

实时流量:更少的代币,相同的分数

基准是一回事,但又是一回事。生产是另一回事。 Fireworks 与两个客户一起对其生产编码工作负载进行了实时 A/B 测试,并报告称,在同等质量的情况下,Ember-1 在每个任务中使用的令牌大约减少了 35%。在一项测量比较中,Kimi K3 在每个任务生成 49,300 个输出令牌时得分为 0.751,而 Ember-1 在 29,900 个令牌上得分为 0.753 — 推理令牌减少了 71.3%,令牌总数减少了 39%。测试结束后,一位客户将 Ember-1 投入实际生产,并计划扩大规模以完全取代基本模型。

在 Fireworks 内部,该模型在发布前已悄然转换为公司自己的编码工作流程。该团队表示最引以为傲的结果是:没有人注意到。开发人员在没有检测到切换的情况下继续工作,同时消耗的代币也大大减少。

专业情报作为战略

Ember-1 是 Fireworks Research 计划系列中的第一个模型,它与该公司的专业智能指数一起推出,这是本月早些时候推出的一项基准测试工作,旨在比较专家创建的现实世界任务的开放、封闭和专业模型。

策略玩法很容易阅读。 Fireworks 没有从头开始训练前沿模型,而是采用了强大的开放权重模型,对其进行了令牌效率训练,现在以更低的每项任务成本销售相同的功能。随着 Moonshot 等实验室的开放式发布不断缩小能力差距,推理提供商发现,持久的差异化可能在于每完成任务的成本,而不是排行榜位置——这一转变有利于拥有强大培训和服务基础设施的公司。

需要明确说明的是:上面的数字来自 Fireworks 自己的博客、自己的评估以及自己的付费客户。在外部工作负载上独立复制代币节省将是真正的考验。但如果结果成立,运行前沿级开放模型的最具成本效益的方法可能不再是让它思考得更少,而可能是运行一个学会有效思考的模型。
---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →