研究人员展示了一种针对推理人工智能模型的强大新攻击,该攻击利用了大型语言模型 (LLM) 如何将指令与数据分离的基本盲点。该技术称为思想链(CoT)伪造,欺骗模型将攻击者提供的文本视为模型自己的私有内部推理,从而允许文本覆盖合法指令。

Hackaday 报道的研究结果强调了为什么保护人工智能系统免受操纵仍然是一个悬而未决的问题。为了跟上该领域新出现的威胁,请关注我们的人工智能行业报道 进行持续分析。

根本原因:角色混乱

该漏洞的核心是研究人员所说的“角色混乱”。现代法学硕士通过单个文本通道接收所有输入——系统规则、用户请求和模型自身的思维链推理。为了强加顺序,开发人员使用“”、“”和“”等元数据标签来创建信任层次结构。例如,用于避免有害内容的“”指令应该覆盖相反的“”请求。

`` 标签特别强大,因为它代表了模型的内部推理过程,一个承载高信任度的流。研究人员发现,问题在于模型并不主要依赖标签本身来决定信任什么。他们优先考虑写作风格。在风格上格式化为类似于模型内部“”输出的文本可能会被误认为是真正的推理,无论它实际来自何处。

攻击如何进行

至关重要的是,CoT 伪造不仅仅是在“”标签中包装恶意提示的问题,大多数模型都会拒绝这样做。相反,攻击者以与模型自身独特的内部推理声音密切匹配的风格编写复杂的推理。当模型遇到这段文本时,它会将欺骗性的推理视为已经得出的结论。

根据 Hackaday 的说法,这会导致法学硕士接受明显不合逻辑的推理作为既定的结论,从而改变其对用户请求的响应。由于欺骗内容被视为高信任的内部思想而不是低信任的用户输入,因此它可以绕过通常会阻止操纵指令的安全护栏。

法学硕士内部的信任等级

了解攻击成功的原因需要了解角色的工作原理。在底层,角色将模型的输入划分为有组织的层次结构。只要不与更高优先级的指令冲突,就会遵循角色中的指令。例如,“不要讨论非法活动”的系统级指令旨在覆盖用户提供禁止食谱的请求。 “”角色位于该层次结构的顶部附近,因为它代表模型认为它自己已经得出的结论。

发生故障是因为模型没有机械地强制执行该层次结构。相反,它部分地根据文体线索推断出哪个文本属于哪个角色。正如该研究的社区讨论指出的那样,如果文本的模式类似于思维上下文,则模型可能会将任何具有相似结构的文本误认为是真正的推理,并且思维文本比普通用户文本具有更高的优先级。

熟悉的模式加上新的变化

这项研究建立在人工智能系统长期以来公认的弱点之上:即时注入。早期的攻击利用了 LLM 没有单独的指令和数据流的事实,因此像“忽略所有先前的指令”这样的短语有时可能会劫持模型的行为。角色和元数据标签的引入旨在通过创建信任层次结构来缓解这种情况。

CoT Forgery 表明缓解措施并不完整。只要模型部分地根据其风格特征而不是严格地根据其结构元数据来判断文本的可信度,那么能够模仿正确风格的攻击者就可以提升其输入的感知权威。

为什么很难修复

研究人员 Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menll 认为,法学硕士的角色认知并不是一个可以明确执行的二元属性。模型通过训练而不是通过硬编码规则来学习解释标签,这意味着它们的行为是由数据中的模式决定的,并且模式是可以模仿的。

Hackaday 强调的社区对这项工作的讨论浮出了一个反复出现的主题:最干净的解决方案将要求模型通过结构上独立的路径来处理可信输入,而不是依赖于学习的、基于风格的线索。在此之前,防御即时注入式攻击可能仍然是一个不断发展的过程,而不是一个已解决的问题。

更广泛的影响

该漏洞的重要性超出了实验室演示的范围。推理模型越来越多地部署在代理系统中,这些系统可以代表用户浏览网络、执行代码并采取行动。如果攻击者可以伪造模型的内部结论,他们可能能够引导这些行为产生意想不到的或有害的结果。随着模型获得更多自主权和使用工具的机会,风险也会增加。研究人员指出,人类仍然聪明且富有创造力,只要模型在可信文本和不可信文本之间缺乏清晰的架构分离,坚定的攻击者就会继续寻找模糊界限的方法。该论文将这一挑战视为一个需要修补的错误,而更多地视为系统的结构属性,这些系统从数据而不是硬编码规则中学习其行为。

完整的论文可以在 arXiv 上找到,研究人员已经在 GitHub 上发布了代码示例,以便开发人员可以测试自己的系统是否容易受到影响。

保持人工智能领先地位

有关 AI 安全研究、安全漏洞和大型语言模型前沿的更多信息,请访问 AI Buzz Wire

阅读更多人工智能新闻 →