阿里巴巴的 Qwen 研究实验室于周五发布了 Qwen 3.8 27B,这是一个获得 Apache 2.0 许可、具有视觉能力的大型语言模型,可以在合理配置的笔记本电脑上运行,并且根据该实验室自己的基准测试,它不仅优于其前身,而且还优于 5 月份 Qwen 最强模型之一的封闭权重模型。

该版本已成为开发者圈本月讨论最多的模型发布之一。著名独立人工智能研究员兼博主西蒙·威利森 (Simon Willison) 周日发表的一篇实践评论登上了《黑客新闻》(Hacker News) 的头版,获得了数百票赞成,读者对该模型的功能及其不寻常的默认配置进行了争论。 更多相关背景,请参阅我们的AI最新动态

Qwen 3.8 27B 的新增功能

该型号是阿里巴巴开放重量系列中的最新型号,在更大的 Qwen 3.8 2.4T-A95B mix-of-experts 发布几周后上市。根据 Qwen 自我报告的基准测试,27B 型号的性能优于 Qwen 3.6 27B 和封闭重量的 Qwen 3.7-Plus,该型号尽管名为 Qwen,但它是今年早些时候 Qwen 任何尺寸中表现最强劲的型号之一。

该模型支持最大上下文长度为 262,144 个令牌,处理视觉输入,并附带对“reasoning_effort”参数的官方支持,该参数可跨三个级别调整推理深度:“xhigh”、“medium”和“low”。

正是第一个设置——“xhigh”,出厂默认值——已经成为该版本的谈论点。

过度思考的问题

Willison 使用 LM Studio 的 17GB Q4_K_M 量化构建在 128GB MacBook Pro 和 NVIDIA DGX Spark 上测试了该模型,他将默认设置描述为产生“壮观的过度思考”。

在一个引人注目的例子中,他要求模型画出一只骑自行车的鹈鹕的 SVG。使用默认的“xhigh”推理工作,该模型花费了 22,276 个推理令牌来生成 3,223 个输出令牌——这个过程在他的硬件上花费了 21 分钟。他指出,结果是“迄今为止最好的鹈鹕 SVG”,他能够使用本地运行的模型生成该模型,该模型具有正确的自行车几何形状、框架两侧的腿以及雅致的插图背景。

权衡是显而易见的:对于大多数任务来说,21 分钟的等待时间是不切实际的。在禁用推理的情况下重新运行相同的提示会在 137 秒内产生响应(不到十分之一的时间),且输出长度相似。

即使是非常简单的提示也会触发该行为。当被要求“绘制一个圆的 svg”时,模型的推理轨迹通过权衡调色板选项、包豪斯风格、分层环和动画方法来打开——对需要单个 XML 标签的形状进行了几分钟的审议。

威利森的结论是:该模型非常出色,但默认配置“绝对不是运行该模型的好方法,尤其是在消费类硬件上。”用户可以切换到“中”或“低”推理努力,或者完全禁用扩展思维。

本地人工智能的发展势头

该版本强调了前沿云模型和本地可运行的开放模型之间的能力差距缩小的速度。现在,在笔记本电脑上运行的 17GB 文件所产生的结果,在特定的创意任务中,可以与不久前所需的数据中心规模模型相媲美。

它还延续了中国实验室定义 2026 年的开放权重势头。阿里巴巴的 Qwen 系列已成为今年全球下载量最大的模型系列之一,与 Meta、DeepSeek 和 Moonshot AI 的版本争夺开发者的关注度。 Qwen 3.8 27B 的独立基准测试结果仍在积累中,Willison 明确警告说,实验室自我报告的数据有待第三方验证。

用户实用指南

对于考虑该模型的开发人员和爱好者来说,早期测试得出的共识很简单:Qwen 3.8 27B 是涉及视觉或长文档的本地 AI 工作负载的强大默认选择,但推理工作应根据任务进行调整。复杂的分析可能会证明“xhigh”是合理的;日常问题和快速草稿在“中等”或以下时更快、更便宜。

通过 LM Studio 等工具运行模型的用户还应该从 8,192 个令牌提高默认上下文窗口 - Willison 发现,在加载完整的 262,144 个令牌上下文之前,模型的扩展思维甚至在普通问题上都耗尽了预算。

更大的问题是,该版本对于开放模型竞赛的下一阶段意味着什么:随着推理式模型成为常态,配置默认值正在转变为具有真正可用性后果的产品决策 - Qwen 的“xhigh”默认值已经是讨论最多的例子。

开放重量级的里程碑

此次发布也标志着开放权重实验室现在可以小规模交付的一个里程碑。两年前,在 Apache-2.0 许可的模型中,适合消费者笔记本电脑的视觉功能、262,144 个令牌上下文窗口和有竞争力的推理性能在 Apache-2.0 许可的模型中是不可想象的。对于构建本地优先应用程序(其中数据隐私、延迟或离线操作排除了云 API)的开发人员来说,实用的选项不断快速改进。

Willison 的测试还强调了生态系统的成熟点:围绕本地模型的工具,从 LM Studio 的一键 GGUF 下载到可配置的推理参数,已经足够先进,以至于调整模型的思维深度现在已经成为用户的常规决策,而不是研究练习。随着未来几天独立基准测试的不断积累,Qwen 3.8 27B 与其开放式和封闭式竞争对手相比的具体情况将会更加清晰——但早期的反应表明,该系列的另一个强势进入使阿里巴巴成为世界上最有影响力的开放模式出版商之一。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →