Inception Labs 周二发布了 Mercury 2.5,这是其商业传播语言模型的新版本,该公司将其描述为市场上最有能力的传播 LLM,并且据其所知,这是有史以来训练过的最大的传播语言模型。根据该公司的公告,该模型的智能性比其前身 Mercury 2 提高了 40%,同时保留了相同的低延迟、低成本服务配置文件,这使得扩散架构对大容量工作负载具有吸引力。
该公司由首席执行官 Stefano Ermon 领导,声称 Mercury 2.5 与成本优化的前沿型号相当,包括 GPT-5.6 Luna(低)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5。这些比较是由供应商报告的,尚未经过独立基准的验证,但它们将扩散模型(长期以来一直是研究的好奇心)定位为自回归现有模型的生产替代方案。有关最新的 AI 模型新闻,请关注 AI Buzz Wire 正在进行的模型报道。 最新AI模型新闻
速度、背景和价格
标题数字非常激进。 Inception Labs 表示,Mercury 2.5 在广泛使用的 NVIDIA GPU 上每秒生成 1,107 个令牌,上下文窗口为 260,000 个令牌。定价设定为每百万输入代币 0.20 美元,每百万输出代币 0.75 美元,发布促销活动将模型打折 80%,至每百万输入 0.04 美元,每百万输出 0.15 美元。
在功能方面,该模型附带可调推理(让开发人员可以根据每个请求以延迟换取深度)以及并行工具调用和用于结构化生成的模式对齐 JSON 输出。该公司将此次发布视为由生产遥测驱动的培训循环的第一个结果:自 Mercury 2 推出以来,数千名开发人员使用它进行了构建,数十家企业已经部署了它,并且使用量增长了一个数量级以上。
为什么扩散模型生成文本更快
来自 OpenAI、Google 和 Anthropic 的主流法学硕士是自回归的:它们一次生成一个标记,每个标记都以之前生成的所有内容为条件。这种顺序依赖性给生成速度带来了硬底。相反,扩散语言模型从一块噪声开始,并行迭代地细化所有标记,一旦模型被训练干净地收敛,传统 GPU 硬件上的吞吐量就会大大提高。
从历史上看,这种权衡一直是质量:扩散模型在推理和指令遵循基准方面落后于自回归模型。 Inception Labs 的核心赌注(以及 Mercury 2.5 的主张)是,这种差距已经缩小到扩散在大多数客户实际感受到的轴上获胜的程度:生产量的延迟和成本。
早期客户的生产要求
该公告主要依赖于客户部署而不是基准表。 OpenCall 是一家为实时客户呼叫构建 AI 电话代理的公司,该公司报告称,迁移到 Mercury 后,其模型响应延迟中值降至约 170 毫秒。 OpenCall 联合创始人兼首席执行官奥利弗·西尔弗斯坦 (Oliver Silverstein) 表示,该公司的 P99 响应时间从几分钟下降到一秒,中位数从 0.4 秒下降到 0.2 秒以下——他称这一数字比该公司测试过的任何其他提供商都要快得多,包括启用推理的情况下。
Augment Code 是一家 AI 编码助手制造商,它使用 Mercury 进行上下文压缩、模型路由和 MCP 工具搜索。据 Inception Labs 称,将压缩工作负载转移到 Mercury 将该步骤的延迟时间从大约 150 秒减少到 27 秒,减少了 82%,并在保持质量的同时降低了 90% 的成本。该用例说明了经济问题的所在:编码代理在每个主要代周围进行许多小型支持模型调用,并且这些调用之间的延迟和成本复合。
运行该模型的硬件公司 NVIDIA 也参与了进来。NVIDIA 加速计算组产品高级经理 Shruti Koparkar 表示,Inception 在 NVIDIA AI 基础设施上拥有先进的基于扩散的语言模型,而 Mercury 2.5 的质量持续提升表明新架构能够以多快的速度成熟为生产就绪系统。
Mercury Voice 和 Mercury Router 预览
除了该模型之外,Inception Labs 还宣布了两款新产品的预览。 Mercury Voice 是一种扩散法学硕士,针对延迟预算最紧的语音代理进行了优化,首次发出令牌的广告时间低于 170 毫秒。 Mercury Router 使用扩散模型来理解传入的提示,并将其路由到提供质量、速度和成本最佳组合的开放或封闭模型,从而将 Inception 定位为高于其竞争对手和竞争对手的一层。
Mercury 2.5 可通过 Inception 自己的 API 以及 Baseten 和 OpenRouter 获得。企业部署增加了专用容量、自动扩展、合规性控制和可配置的数据保留。该公司向尝试该 API 的开发人员提供 1 亿个免费代币。
该公司还表示,它已经开始训练其下一个模型——迄今为止最大的模型,计划在未来几个月内发布——它称其为能力的飞跃,不会放弃扩散的速度或代币效率。如果这种说法成立,那么自回归现有企业将首先感受到市场的商品层的压力,其中价格和延迟决定了大多数合同。
保持人工智能领先地位
随着新模型架构投入生产,关注最新的人工智能发展和人工智能新闻。
阅读更多人工智能新闻 →