谷歌 DeepMind 于 8 月 27 日宣布,全球首次对专有的前沿级人工智能模型进行双盲评估,这是一种加密设置,旨在让外部专家对谷歌的模型进行压力测试,而任何一方都不会看到对方的秘密。

William Isaac、Sol Messing 和 Kristian Lum 在 DeepMind 博客文章中描述了该试点项目,通过加密安全环境中的机密基准运行 Gemini Flash Lite 模型。 Google DeepMind 正在与新加坡人工智能安全研究所、OpenMined、AVERI 和 MLCommons 合作开展这项工作,并发布了一份描述该方法的技术报告。

该公告解决了人工智能评估中最持久的弱点之一:基准污染。对于关注人工智能研究新闻的读者来说,它代表了使第三方模型测试可验证干净的更具体的尝试之一。

污染问题的解释

DeepMind 以课堂比喻开始其公告。如果学生不小心提前看到了考题,那么满分就毫无意义了。同样的逻辑也适用于前沿模型:如果模型已经暴露于基准测试中的问题——通过训练数据、泄露的评估集或先前的优化——得到的分数可能会大大夸大真实能力。

这不是一个假设的问题。基准污染多年来一直困扰着该领域,研究人员一再表明流行的测试集会泄漏到网络规模的训练语料库中,并且可以悄悄地调整模型以在已知的评估中表现良好。当政府和企业使用基准分数来制定采购和政策决策时,夸大的数字会带来真正的后果。

DeepMind 认为,随着模型的能力变得越来越强大,敏感评估类别(其中主要是网络安全测试和政府评估)的风险最高,其中受污染的分数不仅具有误导性,而且具有潜在危险。

旧的权衡:你的提示还是我们的权重

从历史上看,高风险的外部评估迫使人们做出令人不安的选择。要么评估者将其测试提示移交给模型提供者(冒着提供者提前看到测试问题的风险),要么提供者将模型权重移交给评估者(冒着失去其最有价值的知识产权的风险)。

DeepMind 写道,零日志协议和严格的合同保障措施长期以来一直对外部测试提示保密,但这些承诺是由政策而不是数学来强制执行的。双盲评估用加密证明取代了这种信任。

加密盒的工作原理

该试点项目使用 Confidential Space(Google Cloud 机密计算产品组合的一部分)来创建 DeepMind 所描述的加密“盒子”。在其中,评估的两部分(机密基准和专有模型)对其各自所有者而言都是私有的,并且环境以密码方式验证了这一事实。

结果是真正的双盲:外部评估者看不到Gemini模型权重,Google也看不到评估者的测试提示。任何一方都不必相信对方的承诺,因为架构本身原则上不可能发生泄漏。至关重要的是,该设置还可以防止评估数据在以后的测试之前被用来优化模型性能,从而关闭污染通常会重新出现的循环。

为什么人工智能监督很重要

更广泛的意义超越了一种双子座模型。独立组织——人工智能安全研究所、学术实验室、监管机构——多年来一直在努力严格评估封闭前沿模型,正是因为提供商无法交出权重,评估者也不会交出基准。每个主要的人工智能安全机构在与前沿实验室签署评估协议时都在努力解决这个问题。

如果试点成功,它将提供一个模板,在该模板下,数据主权和知识产权可以经受独立审查。 DeepMind 表示,它希望该试点项目“为模型监督建立一个新领域,帮助更广泛的行业构建更安全、更可靠和广泛信任的人工智能系统。”

合作伙伴名单本身就很引人注目。新加坡人工智能安全研究所是最活跃的国家评估机构之一; OpenMined 构建隐私保护计算工具; MLCommons 标准化了行业基准。 AVERI 组建了一个涵盖政府、学术界和行业标准机构的联盟——这些机构需要采用双盲评估才能使其成为一种规范而不是示范。

评估完整性的军备竞赛

这一消息发布之际,人们对人工智能公司如何自我评级的审查日益严格。实验室面临着越来越多的指责,指责他们挑选有利的基准,而独立排行榜之所以变得有影响力,正是因为它们不受供应商的控制。双盲评估将这种独立运动扩展到了供应商自己的基础设施内部——对于历来坚持控制其模型测试的每个细节的公司来说,这是一个显着的转变。

目前,该试点项目涵盖一个模型和一组机密基准。但如果经过密码验证、无污染的评估在技术上成为常规,它可能会改变企业和监管机构对每个前沿实验室的期望,并使“相信我们的分数”在越来越建立在可验证声明基础上的市场上变得更难销售。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →