阿里巴巴的 Qwen 团队于周三发布了 Qwen3.8-Flash-Next,这是一种多模式专家混合模型,可兼作即将推出的 Qwen4 的架构预览,该公司表示,该模型以大约九分之一的训练成本击败了规模大得多的 Qwen3.7-Plus。路透社、彭博社和 The Decoder 都对此次发布进行了报道,在 Z.ai 发布自己的前沿开放模型的同一天,Hugging Face 和 ModelScope 也受到了开放的关注。随着开放重量竞赛的加速,关注突发人工智能新闻。
新架构的缩影
首要规格是效率。 Qwen3.8-Flash-Next 共有 1250 亿个参数,但每个代币仅激活 60 亿个参数。相比之下,Qwen3.7-Plus(它在阿里巴巴发布的基准测试中表现优于该模型)拥有 3970 亿个总参数,每个代币激活了 170 亿个参数,几乎是 Flash-Next 活跃数量的三倍。
技术上最有趣的部分是一个新颖的 N-gram 嵌入层,它携带 510 亿个参数。该层将常见单词组存储为独立条目,The Decoder 的 Matthias Bastian 将其描述为一种“短语词典”,将短语级信息馈送到网络的开头。至关重要的是,它位于常规系统 RAM 中,而不是昂贵的 GPU 内存中,Qwen 团队称其附加成本相对较低,这是 Qwen4 中计划采用的架构创新。
该模型本身支持 262,144 个令牌上下文窗口,并使用 YaRN 长上下文扩展扩展到 100 万个令牌。技术报告发布在 GitHub 上。
基准:编码和办公室工作
阿里巴巴的基准测试将 Flash-Next 与 DeepSeek-V4-Flash(2840 亿个参数,130 亿个活跃值)和 Anthropic 的 Claude Opus 4.6(Max)进行比较。尽管两个竞争对手都更大或更昂贵,但 Flash-Next 在大多数测试任务中处于领先地位,在编码和办公效率方面取得了最大的进步。
在代理编码方面,Flash-Next 在 DeepSWE 1.1 上得分为 58.7,在 SWE-bench Pro 上得分为 62.5,击败了 DeepSeek-V4-Flash 和 Claude Opus 4.6。办公任务方面的差距更大:CoWorkBench 为 73.9,DeepSeek-V4-Flash 为 45.1,JobBench 为 55.7,几乎是 Qwen3.7-Plus 27.6 的两倍。科学推理在整个领域的表现非常接近,Flash-Next 在 GPQA Diamond 上的得分为 91.7,在 LiveCodeBench v6 上的得分为 91.9。 Claude Opus 4.6 仅在 Humanity 的最后考试中领先,为 40.0 至 35.9,并且它是 2026 年 2 月以来的较旧的 Anthropic 模型。一如既往,发布的基准分数和实际性能可能有所不同。
每个竞争对手都面临定价压力
生产版本作为 Qwen3.8-Flash 通过 QwenCloud 发货,价格为每百万个输入代币 0.16 美元,每百万个输出代币 0.47 美元。这甚至低于 Z.ai 的 GLM-5.3-Flash,该产品当天发布的价格分别为 0.15 美元和 0.50 美元——实际上是市场底部的平价。
与阿里巴巴自己的旗舰店相比,差距非常明显。 Qwen3.8-Max 于 8 月初推出,旨在与 Claude Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol 竞争,每百万个输入代币的成本为 2.00 美元,每百万个输出代币的成本为 6.00 美元。根据阿里巴巴自己的数据,Flash-Next 的性能略低于旗舰产品,输入和输出价格约为旗舰产品的十二分之一。
长上下文增加了规格表之外的实用价值。在 262,144 个原生代币中,单个请求可以容纳多个大型代码存储库、完整的合约集或数小时的转录会议;通过 YaRN 扩展到一百万个标记,无需检索脚手架即可进行全语料库分析。对于 Flash-Next 得分最高的代理编码工作负载(在实际软件项目中独立查找和修复错误),大窗口意味着任务中的上下文管理故障更少。 Qwen 团队还在 GitHub 上发布了技术报告,邀请了专有实验室避免的那种独立架构审查。
为什么此版本很重要
Qwen3.8-Flash-Next 最好理解为 Qwen4 的公开彩排。 N-gram 嵌入层、积极的活动参数比率以及大量但很少需要的参数的 RAM 卸载勾勒出一种设计理念:每美元移动智能,而不是每 GPU 移动智能。以九分之一的成本训练击败 Qwen3.7-Plus 的模型正是使快速迭代周期变得经济实惠的能力 - 而迭代速度比任何单一基准更能决定一年后谁站在前沿。
正如 FourWeekMBA 所观察到的那样,来自中国实验室的两个前沿开放权重模型(Z.ai 的 GLM-5.3-Flash 和阿里巴巴的 Flash-Next)的同一天到来也标志着节奏的转变。西方实验室仍然保持着基准峰值,但开放重量级别现在每周都会提供接近前沿的质量,但价格却低了一个数量级。
对于开发人员来说,实际的收获很简单:一个强大的、长上下文、多模式模型的成本再次下降,可下载的权重可以作为针对任何单一提供商的保险。对于竞争对手来说,这个消息不太令人舒服——效率边界现在的移动速度快于旗舰产品定价的实际跟随速度,而阿里巴巴并没有表现出放缓的迹象。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →