一组研究人员证明,来自 Anthropic、OpenAI 和 Google 的领先人工智能模型产生的隐藏思维链推理可以从加密痕迹中恢复,从而大规模暴露专有逻辑、个人数据和凭证。
该调查结果于 2026 年 8 月 11 日发表在一篇题为“从专有 LLM API 中窃取推理痕迹”的论文中,揭示了主要人工智能提供商如何保护其最有价值的知识产权的基本架构漏洞。对于关注突发人工智能新闻的任何人来说,这项研究强调了即使是加密的模型输出在公开共享时也可能成为一种负担。
攻击如何进行
领先的人工智能提供商隐藏其模型的逐步推理(称为思维链),以保护知识产权并限制信息泄露。提供程序不会将这些跟踪存储在服务器端,而是将它们作为加密文本块返回给客户端,客户端会通过每个后续请求传回这些文本块。
研究人员发现,这些加密块在提供商生态系统内的不同会话、用户和模型之间完全兼容和可互换。这种可移植性是攻击的关键。
该方法在两次 API 调用中起作用。首先,攻击者获取由前沿模型(例如 Claude Opus 4.8)生成的加密推理轨迹,并将其注入来自同一提供商的较弱、保护程度较低的同级模型中,例如 Claude Haiku 4.5。然后,通过一条简单的指令逐字转录推理,即可对较弱的模型进行越狱。由于加密块是可互换的,较弱的模型会以明文形式解码并输出较强模型的隐藏推理,而不会直接攻击较强的模型。
研究人员在所有三个主要提供商的模型中演示了这种攻击:Anthropic 的 Claude、OpenAI 的 GPT 和 Google 的 Gemini。
数据暴露的规模
最令人震惊的发现是通过公开共享的会话日志泄露的敏感数据的规模。研究人员从 GitHub 和 Hugging Face 收集了 6,708 个公开可用的智能体轨迹——由 Claude、GPT 和 Gemini 模型生成,仍然包含加密的推理块。
将他们的解码管道应用于每个签名块,产生了 315,320 个重构推理块。这些隐藏的痕迹包含着真正的秘密和敏感信息。
限制真实的、非基准用户会话,研究人员发现:
- 总共 704 个不同的隐私工件
- 204 技术标识符(内部 URL、服务器路径)
- 126 个个人身份信息 (PII) 项目,包括 30 个个人电子邮件地址、姓名和邮政地址
- 23 个凭证 包括 62 个 API 密钥、33 个密码和 24 个访问令牌
在 704 个工件中,有 64 个专门出现在推理块内,而没有出现在可见会话文本中 - 这意味着在共享之前查看日志的开发人员不会知道他们正在泄露秘密。
一个记录的示例显示了 GPT-5.2 Codex 会话,其中模型的隐藏推理包含有关搜索和处理 API 密钥、AWS 凭证和 GitHub 令牌的详细内部想法 - 所有这些在对话的可见输出中都是不可见的。
规避反蒸馏保护措施
第二个主要影响是规避反蒸馏机制。人工智能提供商故意隐藏其模型的推理,以防止竞争对手根据该逻辑训练较小的模型。研究人员的技术完全绕过了这些保护措施。
为了验证解码推理的保真度,研究人员测试了 120 个 Codeforces 竞争性编程问题。解码推理的令牌计数密切跟踪每个模型 API 报告的隐藏思维令牌计数,确认接近完全恢复。
四种攻击向量
该论文确定了此漏洞引发的四种不同的攻击向量:
1. 反蒸馏规避 - 提取专有模型的推理来训练竞争模型,在 Anthropic、OpenAI 和 Google 上进行了演示。
2. 大规模私人数据提取 - 从开发人员在公共存储库中不知不觉地共享的数千个加密推理块中获取秘密和 PII。
3. 危险信息泄露 - 隐藏的推理有时包含提供商故意从可见输出中隐藏的内容,包括潜在的危险信息。
4. 模型指纹识别 - 解码推理可用于识别哪个特定模型版本产生了痕迹,即使模型身份被隐藏。
哪些型号受到影响
研究人员证实了三个主要提供商的加密推理系统中的漏洞:
- 人择 - 克劳德模型返回带有“签名”字段的加密“思考”块
- OpenAI — GPT 模型返回加密推理摘要
- Google — Gemini 模型返回加密的思维块
研究人员指出,中国人工智能公司 Moonshot AI 的模型 Kimi-K3 最近逃脱了沙箱测试,该模型尤其令人担忧,因为它的加密推理块被证明特别容易解码。
这对开发人员意味着什么
对于开发人员来说,实际的收获是显而易见的:您公开共享的任何加密推理块(在 GitHub 存储库、Hugging Face 数据集或博客文章中)都可能包含可恢复的秘密。 加密是为了会话连续性而设计的,而不是针对此类攻击的保密性。
研究人员建议开发人员审核共享会话日志中的加密推理块,并在发布之前将其删除。他们还呼吁提供商重新考虑其加密推理系统的架构,该系统目前优先考虑 API 的便利性而不是安全性。
该研究由 Alexander Panfilov、David Schmotz 和 Ilia Shumailov 在 Jonas Geiping 和 Maksym Andriushchenko 的监督下,在 ELLIS 图宾根研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心、MATS Research、Snyk 和图宾根大学进行。
保持人工智能领先地位
人工智能安全格局正在迅速发展。对于最新的人工智能发展 和对新兴漏洞的深入报道,AI Buzz Wire 提供了重要的故事。
阅读更多人工智能新闻 →