Ox Alpha 是一个无品牌的人工智能模型,自 8 月 20 日出现在 OpenRouter 和 OpenCode 上以来一直主导着开发者的讨论,它的身份不再是一个谜。中国的 Z.AI 周三向彭博新闻证实,该模型是其 GLM 系列的新版本,并表示将于今晚发布该模型的权重,供任何人下载和运行。

这一确认结束了人工智能界今年最疯狂的猜谜游戏之一,它让旗舰级的中国模型与西方实验室发生了碰撞,而西方实验室的同类功能价格却高得惊人。 更多相关背景,请参阅我们的人工智能资讯

完全按照设计进行的秘密发射

Ox Alpha 带来了一份清单,其中描述了有关它可以做什么的所有信息,但没有描述它是谁建造的。 OpenRouter 将其归因于“在此预览期间选择保持匿名的第三方提供商”,并将其定位为为编码、持续代理工作和生产工作负载而构建的推理模型。

仅这些规范就足以引人注目:包含超过一百万个令牌的上下文窗口,支持文本、图像和视频输入,以及通过 OpenRouter 和 OpenCode 完全免费的访问。 OpenCode 宣称该模型每天的服务能力为 100 万亿代币,Nous Research 声称其自己的门户网站可以推送 1000 万亿代币。

在中立基础设施上匿名运行前沿模型,让 Z.AI 在附加其品牌之前收集真实的使用数据和未经过滤的基准测试信息——正如 OfficeChai 在其发布分析中指出的那样,这是一个回避每个开放式中国版本之后的折扣叙述的剧本。

基准测试运行点燃了导火索

这种狂热可以追溯到一个数据点。在发布一天之内,开发人员 Ben Davis 对 DeepSWE 基准进行了非正式的十项任务评估,并报告 Ox Alpha 的首次通过准确率达到 80%,领先于 Claude Fable 5 的 65% 和 GPT-5.6 Sol 的 52%。

这一结果足以让该模型迅速传播开来,并结束 DeepSeek 连续 56 天稳居 OpenCode 排行榜首位的记录。它也立即遭到抵制。在 Hacker News 上,彭博社的确认收到了数百条评论,开发人员敦促谨慎行事,并指出十个任务运行的样本太小,无法解决任何问题,而且该模型在其他排行榜上的结果明显更加复杂。

互联网如何先破案

早在周三的确认之前,社区侦探工作就已经确定 Z.AI(以前称为“智浦人工智能”)为主要候选者。一位名为“dax”的开发人员在 25 个提示中运行了标记器指纹测试,发现 Ox Alpha 的原始标记计数在 11 个探针中的 11 个上与 GLM 的标记器匹配,而其他实验室的模型没有清除其中的 4 个。在一位数字探测中,DeepSeek 的标记器烧毁了 98 个标记,而 GLM 使用了 29 个标记。

单独的分析发现,Ox Alpha 偶然发现了历史上曾绊倒 Qwen 和 GLM 系列模型的同一个“脏令牌”,从而早期将范围缩小到中国实验室。另一个著名的理论——小米的 MiMo 团队此前曾以“Hunter Alpha”的别名运行过与 MiMo-V2-Pro 相同的隐形发射策略——现在看来是一个诱饵。

揭露真相的风险不仅仅在于炫耀的权利。 《纽约时报》周二报道称,中国实验室的模型发布可以测试世界网络安全准备情况,突显出西方政府对此类公开发布的密切关注。

为什么开放权重会改变微积分

Z.AI 确认权重将于今晚发布,这对市场来说是重要的部分。该公司当前的 GLM 5.3 在其第一方 API 上的定价为每百万个输入代币 1.40 美元,每百万个输出代币 4.40 美元,缓存折扣为 81%。据 OfficeChai 称,新模型预计将在 Z.AI 自 GLM 5 以来使用的相同 MIT 许可证下发布。

前沿的编码和代理性能,以西方 API 定价的一小部分公开发布,正是优质实验室花了两年时间试图避免的压力点。它还使 Z.AI 在中国市场的开放权重方面保持与 DeepSeek 的竞争力,在中国市场,可免费下载的模型已成为实验室绝对前沿之外任何事物的默认期望。

接下来看什么

关键细节尚未确认——最重要的是参数数量和模型大小,这将决定该版本对于本地部署的实用性。社区讨论已经集中在模型如何响应量化以及它在消费类硬件而不是数据中心 GPU 上运行的速度。

可以肯定的是,一周的匿名猜测给 Z.AI 带来了任何营销预算都买不到的东西:在中立的基础上进行公正的、与品牌无关的验证。现在模型有了名字,基准测试将会变得更加拥挤,也更加严格。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →