中国人工智能实验室 DeepSeek 发布了 V4.1-Flash,这是一种多模式开放权重模型,将 5520 亿个参数的骨干网与前沿级系统中迄今为止最先进的内存压缩相结合。据路透社报道,该模型于周三上线,并获得了麻省理工学院的 Hugging Face 许可以及随附的技术报告,成为这家位于杭州的实验室的一系列头条新闻。
此次发布不仅仅是常规版本升级。 DeepSeek 同时退役了其旗舰产品 V4 Pro 级别,而动点科技报道称,对 V4 Pro 的请求现在被路由到 V4.1-Flash——这是对带有“Flash”名称但发布基准数据等于或高于其所取代的型号的型号的惊人信心声明。 更多相关背景,请参阅我们的AI行业报道。
更大的“闪存”和更小的内存消耗
根据官方模型卡,DeepSeek-V4.1-Flash 是一个混合专家(MoE)模型,具有 5520 亿个主干参数,加上一个 1960 亿个参数的“Engram”条件内存组件,通过基于令牌的查找进行稀疏访问。尽管规模庞大,该模型在预填充期间仅激活每个令牌 80 亿个参数,在解码期间激活 160 亿个参数——比其 284B 参数前身(后者运行恒定 130 亿个参数)的活动参数要少。
架构的核心是 DeepSeek 所说的 因果编码器-解码器 (CED) 设计:一个 40 层 Transformer 分成一个 20 层因果编码器,然后是一个 20 层解码器。由于解码器的全局 KV 缓存是从最终编码器隐藏状态投影的,而不是逐层累积的,因此维持长时间对话所需的内存急剧减少。
压缩数字是标题。通过采用 E2M1 格式的 FP4 主 KV 缓存,全局 KV 缓存占用空间降至 每个令牌 890 字节,大约是 DeepSeek-V4-Flash 的四分之一。一种称为 SWA Bounded Replay 的技术通过仅重播最近的令牌窗口来重建丢失的注意力状态,将持久 KV 缓存削减到之前 Flash 模型的大约八分之一。根据型号卡,与 V4-Flash 相比,减少量大约为四倍,与 DeepSeek-V1 相比减少了 437 倍。其他组件包括压缩稀疏注意力 2 (CSA2),它为每个注意力层分配三种静态模式之一,以及 DSpark 推测解码以加快生成速度。
在底层,每个 MoE 层将一名共享专家与 384 名路由专家结合在一起,每个代币激活 6 名路由专家。
基准:领先于退役旗舰
在技术报告中的基本模型评估中,V4.1-Flash 在几个关键测试中超越了更大的 V4 Pro: MMLU-Pro 上的 74.1 对比 73.5, HumanEval 上的 79.4 对比 BigCodeBench 上的 76.8、60.6,以及 GSM8K 上的 93.0。据《南华早报》报道,DeepSeek 表示,新模型在网络和编码基准测试中击败 Kimi K3,这是中国开放模型领域的一个引人注目的说法,该领域还包括 Z.ai 的 GLM-5.3 和阿里巴巴的 Qwen 系列。
在最大推理努力下,指令模型在 GPQA Diamond 上得分为 90.9,令人印象深刻,尽管仍然落后于 DeepSeek 自己的比较表中引用的领先前沿系统,GPT-5.6 Sol 为 94.1,Claude Opus 5.0 为 93.4。 Kimi K3 的得分为 92.9。诚实的解读:这是一个开放重量价格的前沿模型,而不是对封闭实验室的彻底清除。
V4.1-Flash 也是真正的多模式。从头开始训练的 DeepSeek-ViT 视觉编码器通过两层投影仪提供图像,并且该模型从预训练开始就对文本和图像进行联合训练。它在 MMMU-Pro 上的得分为 56.5,在 DocVQA 上的得分为 95.6。
专为代理商打造,按量定价
设计选择使目标受众明确:代理工作负载,模型读取大量上下文并在长期范围内采取行动。该模型支持最多一百万个令牌的上下文窗口,在 45 万亿令牌的多模态语料库上进行训练,并提供从 1 到 100 的连续可控推理努力刻度盘,以牺牲推理成本和准确性为代价。 Decoder 的报道强调,内存节省特别降低了运行人工智能代理的成本,即花费更多时间读取输入而不是生成输出的工作负载。
社区反应强烈。 Hacker News 上的发布帖子获得了超过 650 分,较早的题为“DeepSeek 推出比 v4 pro 更便宜、功能更强大的 v4.1 闪存”的帖子还获得了近 400 分。在本地运行模型的评论者指出,Engram 参数甚至可以卸载到快速 SSD,从而为消费类硬件上的近前沿推理开辟了道路。
Seeking Alpha 直言不讳地阐述了商业利益,称其为超低成本模型,给美国前沿实验室带来了挑战——这提醒人们,人工智能推理领域的价格战没有任何降温的迹象。
宣布这一消息的刻意时刻
时机很能说明问题。在发布会前一天,路透社报道称 DeepSeek 已委托中信证券安排在上海科创板首次公开募股,此前有报道称该实验室的收入在可能上市之前已增长了十倍。几天后推出一款引人注目的开放式车型,让这种势头继续下去。
此次发布也是在中国人工智能公司受到严格审查之际发布的。本周早些时候,包括 NSA、CISA 和 FBI 在内的美国机构在一份有关工业规模模型蒸馏的咨询中点名了六家中国人工智能公司,这提醒人们,DeepSeek 的技术胜利现在与地缘政治包袱一起到来。
这些都不会影响工程故事。随着 V4 Pro 的退役,其流量转向更便宜、更强大的模型,DeepSeek 提出了最清晰的论点:到 2026 年,人工智能的有趣前沿可能不仅是谁构建了最大的模型,而且是谁在每 GB 内存中提供了最多的功能。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →