总部位于北京的人工智能公司 Z.ai(又名“智普”)发布了 GLM-5.3,这是其旗舰模型的新版本,该公司表示,这是迄今为止软件工程领域最强大的开放权重系统,并且出人意料地开发了强大的网络安全技能。 GLM-5.3 于 8 月 14 日宣布,并在公司博客文章中详细介绍,GLM-5.3 与其 6 月发布的前身 GLM-5.2 建立在相同的大约 7000 亿参数的基础模型上。该公司表示,每一项改进都来自培训后,而不是更大的基础。该版本是中国开放权重模型浪潮中的最新版本,旨在超越 Anthropic 和 OpenAI 的封闭系统。对于 AI Buzz Wire 模型跟踪器来说,GLM-5.3 是一个明确的信号,表明开放权重前沿正在比许多人预期更快地缩小编码差距。
收益完全建立在训练后
Z.ai 对其 GLM-5.3 的方法直言不讳:“我们所做的只是扩展训练后的规模。”该公司继承了在 GLM-5.2 中引入的强化学习堆栈,包括用于高效长上下文处理的 IndexShare、用于长视野任务强化学习的 SAO,以及用于大规模异步训练的名为 slime 的开源框架。在过去的一个月里,它只是将更多的环境、更多样化的任务和更多的计算注入到该堆栈中。
回报体现在各个编码基准上。在 Terminal Bench 3.0 上,GLM-5.3 从 GLM-5.2 的 4.6 分跃升至 28.3 分,提高了六倍多。它在 Terminal Bench 3.0 和 Agents' Last Exam 上发布了开源的最新结果,并将 ALE-CLI 代理能力衡量标准从 23.8 提高到 28.5。 Z.ai 报告称其内部 Z.ai Code Bench 比 GLM-5.2 提高了 50%,Z.ai Code Bench 是一个私人基准测试,旨在评估现实开发环境中的编码代理并降低公共测试集污染的风险。
至关重要的是,收益来自于更好的代币效率,而不仅仅是更好的结果。在高努力下,GLM-5.3 在内部基准测试中达到了 31.4%,每个任务输出大约 50,000 个代币,Z.ai 表示,这超过了 Anthropic 的 Claude Opus 4.8,完成率为 29.5%,每个任务有 120,000 个代币。 GLM-5.3 仍然落后于 Anthropic 更先进的 Claude Fable 5,后者在最大努力下达到 39.5%。
网络能力的意外飞跃
GLM-5.3 最引人注目的结果不是编码,而是安全性。随着 Z.ai 扩展训练后规模并将漏洞发现数据和环境引入训练组合中,它预计模型在发现和推理缺陷方面会有所改进。令团队惊讶的是这种能力的发展速度如此之快。
GLM-5.3 不仅在发现孤立的错误方面变得更加出色,而且还变得更加出色。它开始对多个利用阶段进行推理,为完整的攻击链形成连贯的计划。在 CyberGym(测试模型是否能够识别和验证白盒源代码中的漏洞的基准)上,GLM-5.3 得分为 84.5%,高于 GLM-5.2 的 77.2%。这是基准测试中的最佳结果,领先于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在需要对真实漏洞及其利用进行更深入推理的 ExploitBench 上,GLM-5.3 的分数是 GLM-5.2 的两倍多,达到 54.4%,尽管它仍然远远落后于 Mythos 5 的 78.0% 和 GPT-5.6 Sol 的 76.5%。
Z.ai 观察到了一个一致的模式:基准测试在开发链上的位置越靠前,相对于 GLM-5.2 的增益就越大,而且与封闭边界的剩余差距也越大。该公司指出:“我们落后的地方正是能力增长最快的地方。”
现实世界的漏洞发现
网络技能并不局限于基准。 Z.ai 报告称,自 GLM-5.2 以来,它一直在与中国的多个安全团队合作,根据现实世界的代码库测试其模型。经过专家评审、筛选和重复数据删除后,该模型发现了 269 个项目的 2,436 个漏洞,其中包括 1,097 个中高严重性问题。调查结果涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用程序和网络协议,其中许多内容多年来甚至几十年都没有引起人们的注意,最古老的可追溯到大约 40 年前。
这些结果与 Anthropic 在其自己的多代理安全研究中描述的工作相呼应,其中协调的代理群被用来大规模寻找开源软件中的漏洞。
开放式举重 — 有延迟
Z.ai 表示,一旦安全评估和硬化完成,它将在两周内发布 GLM-5.3 权重。这种故意的延迟反映了整个公告中存在的紧张气氛:一个比其创建者预期更快地开发出强大的进攻性网络能力的模型正是那种引发了关于负责任发布的问题的系统。该公司强调,其训练-推出一致性已提高到很高的数值精度,并且扩展的大部分难度已从模型本身转移到了现实的、可验证的任务环境的设计上。
竞争格局一目了然。 GLM-5.3 缩小了编码和代理任务与封闭边界的距离,同时在至少一项主要漏洞发现基准测试中占据绝对领先地位。它是作为一个开放权重模型来实现的——这意味着权重一旦发布,任何人都可以免费下载、研究和构建。这种开放性是否会加速进展或引发新的安全担忧,GLM-5.3 肯定会重新引发一场争论。
保持人工智能领先地位
如需了解最新的 AI 模型发布、基准对比和行业分析,请添加书签 AI Buzz Wire。
阅读更多人工智能新闻 →