美国和英国政府人工智能安全机构的联合初步评估得出的结论是,Moonshot AI 的开放权重 Kimi K3 模型在进攻性网络任务上大幅落后于领先的美国前沿模型。该发现于 2026 年 7 月 25 日发布,为围绕中国开发的人工智能系统在美国获得采用时应如何对待的激烈争论提供了具体的数据点。

该评估由位于 NIST 的美国人工智能安全研究所(CAISI)与英国 AISI 共同发布。它是西方对 Kimi K3 专门针对网络领域的第一个官方评估之一。对于关注快速发展的人工智能新闻的读者来说,这一结果并不只是单一基准分数,而是表明政府实验室在外国模型广泛部署之前对其进行审查方面发挥着越来越大的作用。

评估衡量的内容

北京登月AI发布的Kimi K3是一款大型开放式重量模型,一经推出,便因其强大的通用性能迅速受到全球关注。它的开放分布意味着研究人员和开发人员可以直接下载和检查权重,这反过来又使其成为外部安全测试的自然候选者。

新的初步报告集中讨论一个更狭隘、更敏感的问题:该模型在进攻性网络行动(对国家安全机构来说最重要的任务)方面的能力如何?这些研究所没有根据广泛的知识或推理来评估 Kimi K3,而是探讨了它是否可以帮助进行网络攻击、利用软件漏洞或以其他方式协助恶意计算机操作。

数字:大约 32% 与 76%

总体结果是差距巨大。根据评估报告,在网络能力评估中,Kimi K3 得分约为 32%,而美国领先的前沿型号则达到 76% 左右。简而言之,美国研究机构发现,中国模式只能完成西方顶级模式处理的进攻性网络任务的约三分之一。

报道该版本的多个媒体一致地界定了这一差距。 《南华早报》报道称,Kimi K3“在网络攻击能力方面远远落后于美国竞争对手”,而《有趣的工程》强调了网络基准测试中 76% 与 32% 的差距。该评估被描述为初步评估,这意味着这些机构表示在得出任何最终结论之前可能会进行进一步的测试。

为什么可能存在差距

在一般基准上表现强劲但在网络攻击方面表现不佳的模型提出了一个有趣的难题,分析师已经开始权衡。评论员在The Decoder上撰文指出,蒸馏可以解释部分差异。

蒸馏是一种训练技术,模型通过模仿能力更强的“教师”模型的输出来学习,而不是从头开始构建每项功能。分析人士认为,如果 Kimi K3 部分是通过蒸馏开发的,那么它可能会继承由任何作为其老师的模型设定的能力上限,从而可能限制最困难的任务(例如复杂的进攻性网络行动)的性能。

这个假设仍然只是一个假设。初步报告没有解决为什么存在这种差距,只是说明它确实存在。其他可能的因素包括故意的能力限制、训练数据的差异或为保持模型足够高效以在广泛可用的硬件上运行而进行的权衡。

紧张的政治背景

这项评估正值美国更广泛地推动审查中国人工智能系统之际。 7 月初,特朗普政府以网络安全问题为由,重新开始限制在美国境内使用中国开发的人工智能模型,Kimi K3 多次出现在讨论中。美国立法者分别向美国公司施压,要求其解决将外国模型集成到其产品中对数据安全的影响。

在此背景下,政府发现最著名的中国开放重量模型在进攻方面表现不佳,这在两个方面都有所削减。对于那些主张限制的人来说,它提供了官方证据,表明该模型正在得到足够认真的对待,可以进行测试。对于那些对过度扩张持谨慎态度的人来说,相对较低的网络得分也让“每一款中国型号都代表着直接的网络威胁”这一说法变得更加复杂。

对于开放重量采用意味着什么

这一结果还引发了一场关于更广泛的开放权重人工智能的单独辩论。开放权重模型的支持者认为,可免费下载的权重可以实现独立的安全测试,就像 CAISI 和英国 AISI 所进行的那样,从而使开放分发对安全性产生净积极影响。批评者反驳说,同样的开放性降低了恶意行为者修改或滥用有能力的系统的障碍。

就 Kimi K3 而言,开放重量的可用性正是使独立政府评估成为可能的原因。相对温和的网络得分是让政策制定者放心还是敲响警钟,可能不太取决于数字本身,而更多取决于美国和英国机构在未来几周内选择如何制定该数字。

目前,初步评估只是一个参考点:西方国家对 Kimi K3 进攻性网络能力的首次官方评估,并且使其远远落后于经常与之比较的美国前沿型号。

保持人工智能领先地位

网络能力得分只是人工智能安全、监管和全球竞争等更大规模竞赛的一个方面。政策格局每周都在变化,错过一次评估可能意味着错过下一个标题背后的背景。 在 AI Buzz Wire 上阅读更多人工智能新闻,了解每个重要的模型发布、政府裁决和安全评估。

在人工智能竞赛中保持领先——访问 AI Buzz Wire