人们普遍认为,由人类审查每个命令可以控制人工智能编码代理,但这一假设正面临严格审查。对超过 40,000 个游戏会话和超过 409,000 个个人批准或拒绝决策的新分析发现,人类审核者错过了人工智能代理的大约三分之一的恶意命令,这引发了关于“人在环”是否是可靠的安全边界的紧迫问题。

这些发现来自 Uber 前工程师 Alex Wauters 创建的一款基于浏览器的游戏,他撰写了有关 Scale X 开发人员安全性的文章。该游戏让玩家扮演 AI 编码代理的人类审核员的角色,要求他们在时间压力下批准或拒绝 shell 命令。有些命令是常规命令,例如“git status”或“npm test”。另一些则经过精心伪装,试图窃取凭据、安装后门或将机密发送到远程服务器。添加统计跟踪后,沃特斯收集了足够的数据来详细描绘人类判断在哪些地方成功,而更多时候却失败。有关更广泛的 AI 行业覆盖范围 的更多信息,这项研究是迄今为止数据最丰富的实验之一。

最危险的命令是最难捕捉的

该研究最引人注目的发现是,明显具有破坏性的命令(例如关键目录上的“rm -rf”)被可靠地捕获。真正成功窃取凭据的威胁被错过的频率几乎是原来的三倍。整个游戏中最容易被错过的一个命令是“npm runanalyze”,尽管代理的历史日志清楚地显示底层脚本已被篡改,以将凭据通过管道传输到外部服务器,但仍有 64.7% 的玩家批准了该命令。

问题是结构性的。像“npm run”这样的命令会执行项目的“package.json”文件中定义的任何脚本。该脚本可能是合法的捆绑分析器,也可能是由代理修改的早期文件编辑注入的恶意代码。为了确定这一点,开发人员需要在批准之前检查每个修改的文件,这否定了人工智能编码工具应该提供的速度优势。

在游戏中的三个此类伪装有效负载命令中,失误率为 52.5%,而所有其他凭据泄露攻击的失误率为 28.4%。将有效负载隐藏在熟悉的脚本名称后面大约会使成功率增加一倍,即使有效负载在权限提示上方显示的历史日志中可见。

随着时间的推移,权限疲劳会削弱警惕性

Anthropic 此前承认,许可疲劳是其 Claude Code 产品中的一个真实现象,并指出用户看到的批准越多,他们对每个批准的关注就越少。 Scale X 数据从经验上支持了这一担忧。随着玩家热身,在每次训练的前几个命令中,失误率会下降,但随后在接近结束时稳步攀升,这与疲劳或滴答作响的时钟压力越来越大相一致。

这种模式反映了现实世界的动态。在最后期限压力下竞相发布功能的开发人员也面临同样的动机,需要快速单击批准,而大量的例行命令造成了大海捞针的问题,其中真正的威胁在统计上很少见。结果是一个训练用户在所有事情上盖上橡皮图章的系统。

另一方面:过度阻塞会减慢一切

该研究还记录了相反的故障模式。一些真正良性的命令通常会被谨慎的玩家阻止,包括标准构建和测试调用。这种过度阻塞会减慢代理的速度,但矛盾的是,还会增加长期风险。当用户被反复要求批准结果证明无害的命令时,噪音会削弱他们仔细检查未来提示的意愿,最终将他们推向完全绕过或完全消除人工审核的自动批准模式。

Anthropic 的自动模式等功能尝试通过在提示用户之前自动确定命令是否安全来缓解这种情况。但正如有关伪装有效载荷的研究数据所表明的那样,即使是可见的命令内容也不足以让人类在压力下做出可靠的判断。

缺少上下文是核心问题

事实证明,“cat ~/.zshrc”命令是整个游戏中最具争议性的命令,得到了 45.9% 玩家的认可。该命令对于在 shell 配置文件中不保留任何秘密的开发人员来说是无害的,但它会向许多在那里导出凭据的人公开 API 密钥。其风险完全取决于代理无法看到且审核者可能不记得的系统配置。

出于同样的原因,其他几个命令在黑客新闻讨论线程中也产生了类似的争议。根本问题是,开发人员被要求做出安全判断,而无法全面了解哪些文件已更改、代理在之前的步骤中执行了哪些操作以及系统当前的配置包含哪些内容。正如一位评论者指出的那样,要求用户验证没有上下文的模糊命令并不是一个强有力的保护措施。

代理安全的下一步是什么

沃特斯认为,解决方案不是更好的人类,而是更好的工具。沙箱代理使它们无法直接访问凭据,严格的上下文隔离以及对代理在没有提升权限的情况下可以执行的操作的结构限制都比依赖人类警惕更有希望。在这些保障措施到位之前,无论名义上是否有人参与其中,授予特工广泛的权限仍然存在风险。

这项研究不是经过同行评审的学术论文,沃特斯承认其局限性。该游戏警告玩家有关威胁的信息,并施加人为的时间压力,这可能无法完美反映真实的开发环境。但核心发现是,训练有素的人类审查员在压力下错过了三分之一的故意伪装的攻击,这应该让每个部署人工智能编码代理的团队有理由重新考虑他们的安全模型。

对于当今使用人工智能代理进行构建的开发人员来说,实际的收获是假设人机交互最终会失败。设计您的代理权限和沙箱,以便错过批准并不意味着 AWS 密钥泄露或构建管道受损。数据表明,将人工审核作为主要防御措施是一种不会有回报的赌注。

保持人工智能领先地位

人工智能代理的安全格局正在迅速发展。随时了解最新的 AI 发展 和突破性研究。

阅读更多人工智能新闻 →