腾讯发布并开源Hy4预览版,这是腾讯混元团队定位开源前沿的新旗舰大语言模型。这些权重于 8 月 28 日在 Apache 2.0 许可下登陆 Hugging Face、ModelScope、GitCode 和 CNB,同时还提供了用于更便宜推理的 FP8 量化变体。

此次发布加剧了中国实验室之间开放重量前沿模型的竞争,该领域目前包括 Z.AI 的 GLM 系列和 Moonshot AI 的 Kimi 模型。彭博社报道称,腾讯声称新模型在内部测试中优于两个竞争对手,这一说法与所有供应商运行的评估一样值得仔细审查。 更多相关背景,请参阅我们的AI行业报道

标题数字

Hy4 预览版是一个混合专家 (MoE) 模型,总参数为 7700 亿个,其中每个代币激活 490 亿个参数。根据腾讯混元GitHub存储库上发布的官方模型卡,骨干网有78层,256个路由专家加1个共享专家,并为每个代币激活前8个路由专家。内置本机多令牌预测 (MTP) 层(总参数 100 亿个,激活参数 7 亿个)用于推测解码。

上下文窗口是另一个重要的规范:100 万个令牌,这个长度可以让模型一次性处理整个代码库、长法律文档或长达一小时的会议记录。

借鉴竞争对手的架构并建立在其之上

对于旗舰产品的发布,腾讯的文档异常坦率地指出,注意力模块“受到 DeepSeek 和 GLM 的启发”。 Hy4 预览版使用 Gated DeepSeek Sparse Attention (Gated DSA) 结合 IndexCache 进行跨层稀疏索引重用,而残差路径则采用身份超连接 (iHC) 来扩展层间信息流。

开放性对于评估模型的开发人员来说很重要:稀疏的注意力使得 1M 代币上下文在经济上可用,因为在这个长度上天真的完全注意力变得非常昂贵。 DeepSeek 和 Z.AI 都在自己的旗舰机型中推出了这种设计的变体。

专为提高生产力而打造,由内部专家进行调整

腾讯表示,它与公司内部的专家(软件工程师、游戏开发人员、财务分析师和安全专家)合作,并围绕他们实际交付的工作构建了培训数据。该模型卡突出了四个重点领域:

  • 软件工程:改进了长期开发任务的规划、调试和验证,以及前端“视觉品味”的提升。
  • 办公和分析:将杂乱的多文件上下文转换为可共享的文档、电子表格和演示文稿,并更强大地处理方程和财务模型。
  • 游戏开发:从单个提示生成可玩的原型,并在多个细化回合中与游戏引擎流畅地合作。
  • 科学研究:声称在人工智能研究、分子动力学、凝聚态物理和纯数学问题方面取得进展。

腾讯还表示,Hy4 预览版是与自己的产品 CodeBuddy 和 WorkBuddy 共同设计的,因此模型收益转化为产品改进。

腾讯自己的基准测试显示了什么

发布材料中最具体的比较是腾讯对 203 项工程任务的 163 名内部专家进行的盲目并列评估。在这些测试中,Hy4 预览版的平均得分为 2.99,略高于 GLM 5.3 的 2.92(胜率 46.8%、平局 12.8%、败率 40.4%)和 Kimi K3 的 2.94(胜率 51.2%、平局 7.9%、败率 40.9%)。

有两个警告值得明确说明。首先,这些是腾讯内部评估,并非独立基准;该公司尚未在公共排行榜上发布第三次验证的结果。其次,差距很窄——主观专家评级量表上 0.05 到 0.07 分的差距在不同评级池可以轻易翻转的范围内。

随着社区在未来几周内通过标准化编码、推理和代理套件运行模型,独立验证将来自公共聚合。

提早发货,存在已知错误

腾讯明确表示这是预览版。模型卡列出了已知的局限性,包括在复杂的任务中花费超过必要的推理时间,以及过度验证自己的工作的倾向。该团队表示,他们“宁愿尽早发货,听听有什么问题”,并引用了改进 Hy3 一代的方法。

对于部署,权重在 BF16 和 FP8 中均可用,并在 vLLM 和 SGLang 中提供第一天支持。腾讯为两者发布了预构建的 Docker 镜像,并提供了推荐跨 8 个 GPU 的张量并行性和基于 MTP 的推测性解码的配方,以实现对延迟敏感的服务。该模型附带微调管道和 AngelSlim 量化工具包。

为什么它很重要

中国的公开重量级比赛已成为 Z.AI 的 GLM 系列和 Moonshot 的 Kimi 模型之间的两条战线,DeepSeek、Qwen 以及现在更大的混源参赛。 Hy4 预览版结合了 Apache 2.0 许可、770B 参数规模和 1M 代币上下文,提高了任何人都可以下载和自行托管的上限,而第一天的 vLLM 和 SGLang 支持降低了实际运行它的障碍。

对于权衡开放模型与西方封闭 API 的企业来说,实际问题不再是开放模型是否能够在纸面上匹配封闭性能,而是周围的工具(量化、服务、微调)是否足够成熟。腾讯认为,混源在获得许可的情况下一次性发货将是混源重返市场的方式。

内部基准测试声明是否在独立测试下成立将决定 Hy4 预览版是否被记住为真正的前沿开源版本或拥挤领域中的另一个供应商基准测试。权重现已公开,因此社区的裁决应该不会花很长时间。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →