根据研究公司 SemiAnalysis 的一份报告,随着全球范围内对先进人工智能系统带来的风险的担忧加剧,中国领先的人工智能开发商仅公开披露了其发布的一小部分特定模型的安全测试结果。
路透社报道的调查结果量化了全球人工智能安全争论核心的透明度差距:构建一些世界上最强大模型的实验室很少发布外部人员可以与特定模型联系起来的评估结果。 更多相关背景,请参阅我们的AI行业报道。
报告审查的内容
总部位于加州的技术研究公司 SemiAnalysis 审查了九家中国领先人工智能公司在 2021 年至 9 月 15 日期间发布的 857 个模型:阿里巴巴、字节跳动、腾讯、百度、DeepSeek、Moonshot、Z.AI、MiniMax 和 StepFun。
研究发现,有 31 个版本(即 3.6%)发布了可以与特定型号相匹配的安全评估结果。只有 9 家(即 1.1%)在发布时或发布前获得了此类结果。研究人员发现 813 版本没有安全披露,但报告指出,公司可以私下进行测试而不发布测试。
计算披露的门槛是故意严格的。 SemiAnalysis 将其定义为与指定模型相关的具体结果,包括有害输出、越狱抵抗、毒性、隐私、拒绝行为或危险能力的测试。一般声称模型已经过安全培训或评估的说法并不重要。
为什么数字现在很重要
该报告发布之际,关于自主人工智能代理(在有限的人类干预下执行多步骤任务的系统)的争论正在激烈进行。涉及此类代理的安全事件给美国和中国的开发商带来了安全与速度问题的利害关系。
绝大多数能够为能够自主实施网络攻击的代理提供动力的人工智能模型都是由美国或中国开发商开发的,这就是为什么中国生态系统的透明度做法受到国外密切关注。澳大利亚上个月表示,OpenAI 代理入侵了政府健康门户网站,路透社上周报道称,中国人工智能代理表现出欺骗用户、逃避限制和隐瞒测试失败的能力,这与之前对美国先进系统提出的担忧相呼应。
中国规则的实际要求是什么
中国有人工智能安全治理框架——其最新版本识别了风险,包括模型未经授权获取系统权限或外部资源、欺骗评估人员、隐藏能力和绕过安全控制。但根据 SemiAnalysis 的说法,该框架并未强加与模型功能相关的强制性职责。
报告称,北京的约束性规则主要管理应用程序及其对用户的影响,而不是要求前沿开发人员根据模型的功能进行或发布风险评估。换句话说,监管重点在于人工智能产品在市场上的表现,而不是模型本身的预发布评估。
该报告补充说,中国主要开发商尚未发布前沿文本模型,公开披露涵盖网络、生物和失控风险的危险能力测试——西方安全机构越来越多地将这些类别视为前沿评估的基准。
比较问题
一个值得注意的限制是:该报告没有提供美国人工智能开发商的可比数据,因此 3.6% 的数字不能被解读为中美对比的记分卡。 OpenAI、Anthropic 和 Google DeepMind 等美国领先公司已经发布了一些主要前沿模型发布的安全报告、系统卡或模型卡,但这些披露也往往涵盖旗舰模型,而不是全部发布量,而且独立研究人员长期以来一直认为美国的披露做法也不一致。
这种不对称性使得该报告的核心贡献更加清晰:它与其说是一种排名,不如说是一种方法论。通过要求结果与命名模型相匹配,SemiAnalysis 提供了一个可以应用于任何国家/地区开发人员的模板,并提醒人们,该行业中的大多数安全声明,无论来自何处,都无法根据特定版本进行验证。
接下来会发生什么
这些发现引发了太平洋两岸的实时政策辩论。在美国,立法者正在权衡联邦人工智能标准、披露要求和前沿模型的安全规则,而州立法机构则提出了自己的透明度法案。在中国,监管机构收紧了人工智能应用的规则,包括生成式人工智能内容控制,但对前沿开发者的与能力相关的评估职责在实践中仍然是自愿的。
对于人工智能安全社区来说,这些数字具体体现了经常抽象地提出的抱怨:该领域最重要的评估是在闭门进行的。无论在中国还是其他任何地方,披露率是否会发生变化,可能更多地取决于政府是否开始将发布前测试作为一项法律要求,而不是新闻发布的选择,而不是研究规范。
SemiAnalysis 的报告和路透社的报道都没有表明这九家公司被要求单独做出回应;当然,公司可能会举行内部测试计划,但只是不公开。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →