DeepSeek 发布了 DSpark,这是一个开源推测性解码框架,该公司表示,在实时流量下,该框架可将大型语言模型 (LLM) 推理速度提高高达 85%,且输出质量没有任何损失。 DeepSeek-AI 和北京大学的一篇新论文中描述,该系统已经在 DeepSeek-V4 服务基础设施内运行,处理真实的用户请求。

这项工作解决了人工智能生产中最顽固的问题之一:推理速度很慢,因为模型一次生成一个标记文本,每个标记都需要完全通过网络。推测性解码是一种流行的补救措施,其中一个小型、快速的“草稿”模型提出一个令牌块,然后全尺寸模型在单次传递中验证该令牌块,接受最长的正确前缀。由于验证是并行的并且在数学上是精确的,因此它可以加快速度,同时保留原始模型的分布。 DSpark 与 GitHub 上的 DeepSpec 培训存储库一起发布,很快成为 Hacker News 上讨论最多的人工智能工程故事之一。 更多相关背景,请参阅我们的AI行业报道

为什么现有的推测解码会遇到困难

最近的推测性解码研究已经转向“并行起草者”,它在一次前向传递中生成整个候选令牌块,使得起草延迟几乎与块大小无关。 DSpark 论文指出了阻碍这些方法大规模实现其承诺的两个瓶颈。

首先是质量问题。由于并行绘图者独立预测每个位置,因此他们无法对块内的令牌如何相互依赖进行建模。研究人员表明,这会导致“多模式碰撞”和草稿块后面位置的快速接受度衰减,他们将这种现象称为后缀衰减。平行块越长,其尾部出错的可能性就越大。

二是制度层面的问题。虽然生成长草稿区块的成本很低,但盲目验证每个提议的代币会浪费稀有的批量容量,而代币可能会被拒绝。在真实服务系统的高并发情况下,理想的验证长度沿着两个轴变化:代码等结构化请求比开放式聊天维持更高的接受率,并且在轻负载下验证额外的令牌几乎是免费的,但在系统饱和时验证成本很高。

半自回归草案模型

为了修复后缀衰减,DSpark 采用了作者所说的半自回归架构。它将计算量大的并行骨干网与引入块内依赖建模的轻量级顺序模块结合起来,该骨干网可以一次提出许多令牌。该设计旨在将早期位置并行模型的高容量与传统自回归绘图器的后缀一致性相结合,这些绘图器会依次生成令牌并自然地尊重依赖性。

在涵盖数学推理、代码生成和日常聊天的受控离线基准测试中,该团队报告称,与强基准相比,DSpark 大大提高了每个验证周期可接受的长度。具体来说,该论文指出,在三种设置中,DSpark 比自回归 Eagle3 绘图器的可接受长度提高了 30.9%、26.7% 和 30.0%,比并行 DFlash 绘图器提高了 16.3%、18.4% 和 18.3%。

置信度计划、负载感知验证

DSpark 更新颖的部分是它的验证方法。 DSpark 不是为每个请求验证固定数量的草稿令牌,而是将验证长度选择制定为全局吞吐量最大化问题。它将草稿的前缀可能存在多久的校准估计(本文称之为生存概率)与读取实时引擎负载的硬件感知调度程序配对。

结果是信心计划的验证:系统根据请求的内容和服务引擎的当前状态动态调整为每个请求验证的令牌数量。在轻负载下,它可以进行大量验证,而在高并发情况下,它仅将目标模型的验证预算路由到具有最高预期回报的令牌,从而避免因在低概率令牌上花费批量容量而导致的吞吐量崩溃。

实时用户流量下的结果

最重要的数字来自生产。该团队在 DeepSeek-V4 服务系统内部署了 DSpark,为实时用户流量提供服务,并将其与公司之前的生产基线(一种称为 MTP-1 的多令牌预测方法)进行比较。

根据该论文,在匹配的聚合吞吐量下,DSpark 持续将 DeepSeek-V4-Flash 的每用户生成速度提高 60% 至 85%,将 DeepSeek-V4-Pro 的每用户生成速度提高 57% 至 78%。在严格的服务级别协议下,基线的容量严重恶化,相当于 Flash 每秒 120 个令牌,Pro 每秒 50 个令牌,DSpark 减轻了验证开销以保持强大的吞吐量。作者认为,通过克服绩效悬崖,它解锁了以前无法实现的严格交互层,有效地将法学硕士服务的帕累托边界向外转移。

这种区别对于运营商来说很重要。在相同的总吞吐量下,每个用户的速度更快,意味着无需购买更多硬件即可获得响应更快的助手和代理工作流程,而在负载下满足严格的延迟 SLA 则是研究演示与能够在流量高峰期间保持稳定的系统的区别。

为社区开源

DeepSeek 正在为 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro 预览模型发布经过训练的 DSpark 检查点。随附的 DeepSpec 存储库在 MIT 许可下发布,被描述为用于推测解码的全栈、算法驱动的训练和评估代码库。它包括数据准备实用程序、草稿模型实现、训练脚本和评估工具,并附带三种草稿模型算法:DSpark、DFlash 和 Eagle3。

该版本降低了其他实验室和基础设施团队根据标准化管道训练和基准测试自己的草稿模型的障碍。 DeepSpec 的评估套件涵盖既定基准,包括 GSM8K、MATH500、AIME 2025、HumanEval、MBPP、LiveCodeBench、MT-Bench、AlpacaEval 和 Arena-Hard-v2。

为什么它很重要

推理成本和延迟现在是人工智能行业的决定性限制之一,影响着一切,从公司如何积极部署人工智能代理到较小的提供商是否可以在单位经济效益上与超大规模提供商竞争。 DSpark 的贡献与其说是一个单一的新算法,不如说是一个演示,仔细地共同设计草稿模型和验证调度程序,并将验证长度视为实时系统状态的函数,可以在实际部署中有意义地推动发展。

对于以高效、公开发布的系统而闻名的 DeepSeek 来说,DSpark 是该实验室一年多来一直争论的另一个数据点:前沿级的服务性能可以通过更智能的工程实现,而不仅仅是通过原始计算。事实上,增益是在实时流量下测量的,而不是在综合基准中测量的,这使得随着开源社区消化该论文并开始复制数字,其他运营商更容易认真对待这一结果。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →