应用安全公司 Semgrep 的新基准给出了意想不到的结果:中国智普人工智能的开放权重模型在发现软件中的真正安全缺陷方面优于 Anthropic 的 Claude。这一发现加剧了关于最有能力的人工智能是否一定是最昂贵的或最受限制的争论。

由于 Anthropic 强大的 Mythos 模型受到美国出口禁令的限制,寻找可用替代方案的安全团队正在转向开放权重选项,例如 GLM 5.2,以获取最新的 AI 行业报道。 Semgrep 于 6 月 22 日发布的测试表明,狩猎可能比预期更快获得回报。

Semgrep 测试的内容

Semgrep 在其内部 IDOR 检测基准上评估了一系列开放权重和前沿模型。 IDOR(不安全的直接对象引用)是一种访问控制错误,可让一个用户访问另一用户的数据。众所周知,传统的静态分析很难捕获它们,因为缺陷是逻辑上的而不是语法上的:代码在技术上是有效的,只是缺乏授权检查。

该公司一直在通过将基于规则的引擎与人工智能推理相结合来完善发现这些漏洞的工作流程。为了隔离模型本身与周围支架的性能差异,研究人员通过一个最小的工具运行了一组流行的开放权重模型——一个简单的 Pydantic 设置,使用为每个模型提供的相同 IDOR 提示,没有端点发现,也没有引导导航。该提示仅提供了一个基本的搜索策略和一些关于 IDOR 的外观的提示 - 比“这里是代码,查找错误”多一点,但远少于前沿编码代理在 Semgrep 的完整管道内运行时收到的内容。

IDOR 一直是应用程序安全团队头疼的问题,因为它们无法通过传统扫描仪的检测。基于规则的工具可以标记丢失的输入检查,但了解特定端点是否实际上公开了另一个用户的数据需要推理应用程序的业务逻辑——这正是大型语言模型越来越擅长的上下文判断。

GLM 5.2 领先

其中最出色的是智普AI的开放权重模型GLM 5.2。仅运行一个简单的提示,它在 IDOR 检测上的 F1 得分为 39%,比 Claude Code 的 32% 高出 7 分。据 Semgrep 称,开放权重模型在该任务上也超越了 Claude Opus 4.8,使其成为测试中最强的非前沿选项。

经济效益同样引人注目。按照 GLM 5.2 的定价,每个发现的漏洞的运行成本约为 0.17 美元。 Semgrep 指出,对于可能扫描数千个端点的组织来说,每个错误的成本通常是检测技术是否大规模实用的决定因素。

其他公开重量级的竞争者则落后得更远。 MiniMax M3 的 F1 得分为 23%,Kimi K2.7 Code 的得分为 22%,两者均远低于 Claude Code。 Semgrep 将 GLM 5.2 描述为明显的例外,而不是开放权重类别的代表性结果。

安全带仍然很重要

尽管在原始提示类别中取得了公开重量级胜利,但 Semgrep 自己的专用管道仍然处于总体领先地位。该公司的多模式设置将人工智能推理与基于规则的检测和结构化端点枚举相结合,实现了 53% 至 61% 的 F1,具体取决于配置。这一差距凸显了研究人员最初的问题:模型的漏洞检测性能有多少,围绕它的架构有多少?

答案似乎是“两者都有,但比人们想象的更重要的是安全带。” GLM 5.2 证明,一个有能力的模型可以在最少的支持下完成有意义的工作,但它仍然无法与专门针对该问题设计的系统相匹配。

Semgrep 团队包括研究人员 Paxton-Fear、Seth Jaksik、Brenden Noblitt 和 Erik Buchanan,他们表示,他们“真正感到震惊”的是,运行简单提示的开放权重模型在推理繁重的安全任务上超越了前沿编码代理。

家里的神话

在当前的地缘政治背景下,该基准具有更大的影响力。这篇博文的标题——“我们家里有神话”——尖锐地提到了这样一个事实:Anthropic 的以网络安全为中心的神话模型实际上对世界上的大部分地区来说是无法使用的。在特朗普政府禁止非美国公民使用《神话》及其受限制的兄弟《神鬼寓言 5》后,全球安全团队无法使用被广泛认为是最有能力进行进攻和防御安全工作的人工智能。

在这种真空中,易于使用的开放式重量模型正在填补这一空白。事实上,GLM 5.2(可免费下载并可在任何地方部署)已经可以在特定安全任务上匹配或击败前沿专有模型,这表明出口禁令的寒蝉效应可能比预期的要小。如果最好的“无限制”模式不断改进,囤积前沿能力的战略价值就会减弱。

目前,结果很窄:针对单一类别漏洞的单一基准。但这是一个信号,表明开放权重前沿的关闭速度比许多人想象的要快,而且可访问性(而不是原始能力)可能成为人工智能安全领域的决定性变量。

这一发现也给前沿实验室提出了令人不安的问题。如果免费提供的模型已经可以在安全推理任务上与专有系统相匹配,那么围绕封闭模型的竞争护城河就会缩小——特别是当出口管制使这些封闭模型无法进入全球市场时。开放重量的开发人员不受使用限制的影响,可以同时在任何地方进行迭代和部署。

保持人工智能领先地位

前沿人工智能和开放式人工智能之间的差距正在缩小突发人工智能新闻 以及重塑安全、基础设施和政策的研究。

阅读更多人工智能新闻 →