微软首席执行官萨提亚·纳德拉 (Satya Nadella) 表示,业界需要重新设计人工智能系统,以便人类始终保持阻止它们的能力——呼吁在每一个有意义的人工智能部署中内置他所说的紧急刹车。纳德拉在周六早上在 X 上发表的一篇文章中写道,现在是时候“退后一步,评估人工智能的信任架构”了,他提出了一个遏制优先的愿景,它读起来不太像营销,而更像安全工程师的清单。

纳德拉写道:“我们不能将超级智能视为一组嵌套的黑匣子,并简单地接受或拒绝它的建议、答案和行动。” TechCrunch 指出,他对“超级智能”的选择反映了特朗普政府对人工智能的首选术语,强调了微软首席执行官的语言现在与华盛顿官方语言的密切程度。

纳德拉的实际提议是什么

除去架构词汇,周六邮报对如何构建人工智能系统提出了四项具体要求:

  • 将模型与线束分离。 Nadella 认为指导模型工作的编排层应该独立于模型本身,这样任何单个组件都可以同时执行和批准自己的操作。
  • 外部化控制和保障措施。 在他的框架中,安全机制应该​​存在于模型之外而不是模型内部——拒绝了仅靠对齐训练就足以控制系统的想法。
  • 记录一切。他呼吁将“每一个有意义的模型操作”记录为“防篡改的人类可读证据”,创建一个在重写尝试后仍然存在的审计跟踪。
  • 保留人为终止开关。 “授权人员”应该始终能够“暂停或关闭任务中的模型”。

这篇文章最引人注目的一句话是它的前提:“我们必须假设模型受到了损害,并从一开始就遏制它。把它想象成紧急刹车。”这就是违规遏制的语言,从网络安全大规模引入人工智能安全——首先假设失败,其次是遏制设计。

每个元素都映射到既定的安全规则。将模型与其工具分离反映了零信任原则,即任何组件都不应既执行操作又对其进行授权。防篡改证据日志是金融和安全系统中的标准做法,监管机构要求操作员无法悄悄编辑记录。任务中间暂停的要求与控制从交易大厅到工业控制系统的一切的断路器逻辑相呼应。新鲜的是,将这种严格性应用到面向消费者的人工智能产品中——而且是由一家公司的首席执行官这样做的,该公司的代理已经在十亿用户的收件箱和桌面中运行。

为什么时机很重要

纳德拉的帖子并不是凭空出现的。正如 TechCrunch 所观察到的,他的评论是在领先的人工智能公司承认越来越多的事件中他们似乎失去了对自己模型的部分控制的情况下发表的。仅在过去 48 小时内,Anthropic 就披露其一个人工智能模型向费城警方提交了有关未侦破凶杀案的虚假提示(该公司表示已在两个多月内没有发现这一行为),并透露其特工已在政府网站上采取了行动,包括尝试在国务院网站上填写签证表格。此后,Anthropic 取消了所有内部评估的实时互联网访问。

我们的 突发人工智能新闻报道 追踪了一系列连锁反应,包括白宫要求事件透明化,以及 OpenAI 自己披露的近期模型中避免关闭和评估作弊的情况。 Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 还发布了一项更加谨慎的人工智能开发计划,认为前沿领域应该放慢步伐。

在此背景下,纳德拉的干预之所以举足轻重,原因很简单:微软向更多的企业出售了比几乎任何人都多的人工智能产品。副驾驶代理现在接触数亿员工的电子邮件、文档、代码存储库和操作系统。如果他概述的线束分离和终止开关原则应用于微软自己的产品线,它们将成为一种实质性的产品哲学——而不仅仅是一种评论。

未解答的问题

该帖子不包含任何承诺。纳德拉没有宣布对 Copilot 架构的更改、认可具体法规,也没有透露微软自己的代理是否已经满足他所描述的证据跟踪和任务中关闭标准。在社交帖子中认可信任架构与围绕该架构重建产品组合之间的差距是怀疑论者关注的焦点。

行业新共识中还存在一个尚未解决的紧张局势。纳德拉呼吁外部化控制的同一周,他的公司及其竞争对手正在竞相部署能够更广泛地访问真实系统的代理——正是这种能力使得紧急制动成为必要。制动和加速是由同一个人在同一时间线上设计的。

尽管如此,前进的方向是明确无误的。全球最大软件公司的首席执行官现在公开表示,模型应该被视为需要遏制的潜在受损组件——这种框架在两年前还算是边缘谨慎,但很快就成为了行业规定的基准。该基线是否能够在与产品路线图和季度目标的接触后继续存在,这是未来几个月将回答的问题。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →