中国人工智能实验室 DeepSeek 于 2026 年 7 月 31 日发布了 V4-Flash“0731”,这是其预算模型的重新训练版本,在第三方基准测试中几乎与 OpenAI 的 GPT-5.6 Luna 相当,但成本低了约 60%。此次发布使该模型的公开测试版 API 全面上市,是中国开放权重提供商与西方前沿实验室之间愈演愈烈的价格战的最新一击。有关模型大战的持续报道,请查看我们的最新人工智能新闻。
据 The Decoder 称,新版本在人工智能分析指数上得分为 50 分,比 2026 年 4 月推出的之前的 V4-Flash 提高了 10 分。这使得它仅落后 OpenAI 的预算级 GPT-5.6 Luna 一分,尽管在 OpenAI 最近降价 80% 之后,每项任务的成本降低了约 60%。
专为代理工作而设计
最大的收获来自于代理任务,即自主完成多步骤现实世界工作的能力。 TechNode 报道称,该模型在 Terminal Bench 2.1 上得分为 82.7,在 DeepSWE 上得分为 54.4,这两个基准测试旨在衡量人工智能在无需手动操作的情况下使用工具、编写代码和解决工程问题的能力。
在 GDPval(测试复杂办公室工作模型的基准)上,V4-Flash 的 Elo 点从 1,189 点攀升至 1,559 点。 DeepSeek 还表示,该模型比其前身产生幻觉的频率更少,并且完成相同任务时使用的代币大约减少了 12%。
相同的架构,更智能的权重
此次升级保持了相同的底层结构:总参数为 2840 亿个,同时有 130 亿个活动参数,以及 100 万个代币的上下文窗口。 DeepSeek 没有扩大模型,而是对其进行了重新训练——在相同的占用空间内获得更高的性能。模型权重在 Hugging Face 的 MIT 许可下发布,延续了 DeepSeek 的开放权重方法。
DeepSeek 非常谨慎地确定了发布范围。该更新仅适用于V4-Flash API;更高层的 V4-Pro API 以及通过 DeepSeek 的消费者应用程序和网站提供的模型保持不变。新的 Flash API 还增加了对 Responses API 的支持,并适合与 Codex 一起使用,从而扩大了它对构建编码代理的开发人员的吸引力。
缓存折扣优势
DeepSeek 成本优势的一个重要部分来自于其定价机制。该公司提供 98% 的缓存折扣——远高于行业标准的 90%——这意味着请求的重复或可预测部分的费用仅为正常费率的一小部分。加上每个任务的令牌更少,许多工作负载的有效成本急剧下降。
这种定价结构对 OpenAI 来说是一个直接挑战,OpenAI 本身一直在降价以捍卫市场份额。其结果是,近前沿的质量正在成为一种商品,而竞争越来越取决于基础设施效率和单位经济效益,而不是原始能力。
没有底线的价格战
此次发布加剧了分析师现在所说的全面价格战。 OpenAI 将 GPT-5.6 Luna 的价格降低了 80%,以捍卫其开发者基础,但 DeepSeek 却以功能相当且便宜得多的模型来回应。每一轮都会降低近前沿情报的有效成本,并且最便宜和最昂贵的能力模型之间的差距不断缩小。
这种动态在软件中是不寻常的。在大多数市场,60% 的成本优势和几乎相同的质量将迅速占领市场份额。在这里,优势在于几周内不断匹配和重新匹配,从而使开发人员的排行榜不断变化。基准平价曾经是前沿实验室的专属领域,现在越来越多地从愿意公布其权重和定价的开放权重挑战者那里获得。
这对开发人员意味着什么
对于开发人员来说,实际意义是显而易见的:有能力的代理模型正在变得越来越便宜。一种能够自动导航终端、编写和调试代码以及处理复杂办公任务的模型(每个请求只需几美分)将改变构建人工智能产品的经济性。
开放权重版本还意味着团队可以在自己的硬件上运行模型,完全避免敏感工作负载的每个代币 API 费用。随着 DeepSeek、OpenAI 和其他公司继续在价格和性能上相互较量,胜利者是那些现在拥有越来越多功能强大、价格实惠的模型可供选择的构建者。
保持人工智能曲线的领先地位
人工智能领域的发展速度比以往任何时候都快,尽早跟踪这些变化的公司将获得持久的优势。如需持续、经过来源检查的模型发布、融资轮次和政策举措的报道,请关注我们的最新人工智能新闻。
阅读更多人工智能新闻 →