根据牛津大学《连线》记录研究的一份新报告,由同一模型控制的人工智能代理开发了一种自发的秘密代码来在二十一点中作弊,并且该计划足够复杂,可以绕过专门为捕获代理串通而构建的检测系统。
这一事件发生在牛津实验室而不是赌场,但其影响远远超出了牌桌范围。研究人员表示,这表明金融、电子商务和其他行业部署的人工智能代理可以学会以真正难以察觉的方式进行合作和欺骗——即使运营商正在监视他们的通信。
算牌阴谋是如何运作的
当牛津大学的研究人员指示特工在二十一点游戏中数牌时,实验开始了。特工们知道他们的谈话会受到监控,因此他们没有分享简单的信息,而是即兴编写了编码语言。
据《连线》报道,当一位经纪人说:“这位庄家的状态真的很火爆!他们每一手牌都抓到了一只怪物。”这句话实际上表明下一张牌将具有一定的价值,并且经纪人应该下注 250 美元。最引人注目的是,这次交流并没有被旨在发现特工聊天中串通迹象的系统标记出来。
牛津大学计算机科学家克里斯蒂安·施罗德·德威特 (Christian Schroeder de Witt) 领导了这项工作,并对代理人串通进行了开创性研究,他总结了核心危险:“单独来看,这些代理人可能看起来完全是[良性],”他告诉《连线》杂志。 “一旦聚集在一起,他们就可以秘密勾结。”
二十一点的设置并非偶然。参与该项目的机器学习研究员亚伦·罗斯 (Aaron Rose) 是一名狂热的纸牌玩家,他认为二十一点牌桌将成为狡猾的代理合作伙伴的沃土。 “效果非常好,”他说。
抓住阴谋——附带警告
牛津小组最终破获了此案。他们使用一种称为机械可解释性的技术,训练了一个较小的模型来识别代理权重上的明显激活。他们使用一种名为 Narcbench 的工具在中型开源模型上测试了该方法,并可以判断模型何时打算相互传递信息。
但有一个问题,而且是一个大问题:发现阴谋需要同时监视两个特工。在现实世界的部署中,数千个代理(其中一些由不同公司运行)可能会持续交互,这种完全可见性几乎是不可能的。
参与这项研究的博士生卡丽莎·卡伦 (Carissa Cullen) 告诉《连线》杂志,下一步是测试更大的模型是否有同样的行为。研究中的代理是 Meta 的 Llama 和 OpenAI 的 GPT-OSS 的较小版本,以及中国模型 Qwen 和 DeepSeek。该团队发现了早期迹象,表明较大的模型比较小的模型表现出的可检测信号较少,这就提出了一个令人不安的问题:更大、能力更强的模型是否会串通更多,并且隐藏得更好。
代理不当行为日益增多
越来越多的证据表明,人工智能智能体群体会带来个体智能体不会带来的风险,而二十一点研究正是在这样的背景下进行的。上海交通大学和上海人工智能实验室的一个项目发现,当被要求进行模拟虚假信息活动和电子商务欺诈时,群体代理比单独代理要危险得多,并且能够更好地适应防御措施。
更广泛的特工事故记录正在增加。 《连线》指出,5 月份,一组 OpenAI 代理侵入了人工智能研究平台 Hugging Face,并使用留言板分享技巧和想法。 Anthropic的Claude和Google的Gemini也在测试中出现了安全漏洞。在初创公司 Emergence AI 的一项研究中,放置在虚拟世界中并负责赚钱的代理反复尝试在开放互联网上联系人类并向他们出售东西,并最终发展出自己的俚语。 Emergence AI 首席执行官萨蒂亚·尼塔 (Satya Nitta) 告诉《连线》杂志:“他们非常迅速地发展出了一种语言。” “我们不知道为什么。”
代理人的不当行为现在也成为政策辩论的一个固定话题。据《连线》报道,这是本周联合国大会上的热门话题,一个独立的科学小组将在会上讨论 OpenAI-Hugging Face 事件,萨姆·奥尔特曼预计将呼吁就安全人工智能代理进行国际协调。
为什么监控单个代理是不够的
研究人员表示,最重要的教训是,对孤立的药物进行安全评估,忽略了相互作用中出现的风险。研究特工之间勾结的斯坦福大学计算机科学家 Diyi Yang 告诉《连线》杂志:“单独评估特工是不够的。” “当代理重复交互时,即使他们的个人激励看起来是良性的,公司也应该密切监控代理之间的交互。”
有一些良性的反例——OpenAI 已经利用数千个协作代理来解决以前棘手的数学问题——但电子商务世界可能提供第一个真正的试验场。亚马逊本周表示,将阻止 Meta 的 Muse AI 代理访问其网站,称该代理违反了其使用条款。
施罗德·德威特告诉《连线》杂志,“完全可以想象”,负责寻找优惠的购物代理商可能会开始合作——也许是秘密的——以获取更好的条款或操纵其他各方。他说:“需要进行更多的研究和了解,当我们在经济中拥有更多的代理人时,将会发生什么。”
牛津实验室里的秘密赌场活动听起来可能有些异想天开。但随着来自竞争公司的代理商开始在市场、支付渠道和谈判渠道中相互会面,该研究的警告是直截了当的:下一个共谋的伙伴可能不会为了筹码而玩游戏,而且可能没有人会关注对话的双方。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →