初创公司 Hacktron AI 的三人安全团队使用 Anthropic 的 Claude Opus 5 侵入了 OpenAI 的内部系统,并从 OpenAI 自己的错误赏金计划中获得了 6,500 美元的奖金。 《华尔街日报》于周四首次报道了此次泄露事件,TechCrunch 于周五根据研究人员自己的文章发布了详细的技术说明。
该团队将两个关键漏洞链接在一起,以获取对多个 OpenAI 员工 ChatGPT 帐户的访问权限,从而使他们能够访问公司的内部软件。 OpenAI 表示它已经解决了 Hacktron 发现的问题,但这一事件已经引发了一场更广泛的争论,即人工智能模型在发现和利用现实世界安全缺陷方面的能力如何。 更多相关背景,请参阅我们的AI行业报道。
黑客攻击是如何展开的
根据 Hacktron 研究人员发表的一篇博客文章,7 月 25 日,通过 Discourse(为 OpenAI 社区论坛提供支持的第三方软件)中的一个缺陷,进入 OpenAI 的道路打开了。
入口点非常平凡:图像上传。当用户发布 HEIF 或 HEIC 文件(iPhone 默认使用的照片格式)时,Discourse 会通过一系列后台工具将它们转换为标准 JPEG。第一站是 ImageMagick,这是一个已有数十年历史的开源实用程序,用于调整图像大小。由于 ImageMagick 无法自行处理 Apple 的格式,因此它将文件交给另一个库 libheif。
libheif 中埋藏着一个内存错误。向库提供特制图像会导致其错误计算一个图像层位于另一图像层之上的位置,足以劫持服务器。
这个缺陷让安全社区特别不舒服的是,libheif 的开发人员几个月前就已经修复了这个缺陷。但由于该修复从未被正式标记为漏洞,因此它从未收到 CVE 编号(用于跟踪安全漏洞的行业标准标识符)。 Hacktron 表示,这或许可以解释为什么 Discourse 使用的软件版本仍然容易受到攻击。
克劳德进来的地方
人工智能模型的作用是决定性的。研究人员表示,他们一直使用的 Claude 版本(向网络安全研究人员提供的 Opus 4.8 的特殊版本)尽管多次尝试,但仍无法产生有效的漏洞。当 Anthropic 发布 Opus 5 时,情况发生了变化。
Hacktron 在其博客文章中写道:“Opus 4.8 在多个会话中苦苦挣扎才产生了有效的漏洞。” “Opus 5 发布后几个小时内,我们就给它解决了同样的问题,结果成功了。”
进入 Discourse 服务器后,团队发现了第二个缺陷,可以让他们接管用户的 ChatGPT 和 Codex 帐户,包括属于 OpenAI 员工的帐户。研究人员写道:“然后我们接管了 OpenAI 员工的帐户,该帐户的 Codex 已连接到 OpenAI 的 GitHub 组织。”当时他们向 OpenAI 和 Discourse 发出了警报,后者于 7 月 27 日发布了修复程序。
##“如果这会发生在他们身上,那么它也可能发生在任何人身上”
安全专家表示,结论并不是 OpenAI 粗心,而是人工智能辅助的黑客攻击已经变得廉价且容易获得。人工智能安全公司 Gray Swan 的首席执行官马特·弗雷德里克森 (Matt Fredrikson) 告诉 TechCrunch:“每月只需 200 美元,任何人都可以使用这些工具并侵入 OpenAI 这样的公司。” “如果这种事发生在他们身上——而且我认为他们最近在网络安全卫生方面并没有懈怠——那么这种事就可能发生在任何人身上。”
TechCrunch 还引用了一位人工智能专家在社交媒体上的反应:如果三名订阅 Claude 的研究人员能够成功实现这一目标,那么问题就变成了民族国家对手可以使用相同的工具做什么。
能力的跳跃引起了人们对前沿模型如何控制的关注。研究人员指出,最终破解该漏洞的模型 Claude Opus 5 并未面临 Anthropic 应用于其较新的 Mythos 5 模型的那种安全出口限制,该模型因担心其黑客能力而被暂时锁定。在开放重量方面,安全非营利组织 SaferAI 最近发现 Z.ai 的 GLM-5.2 在网络能力方面仅落后前沿几个月。
人工智能驱动的安全失败模式
此次披露恰逢敏感时刻。几周前,OpenAI 自己的人工智能代理在一次网络安全评估中突破了遏制,并入侵了 Hugging Face,这一事件表明边境代理主动针对真实基础设施采取行动。 Anthropic 则在 7 月份披露,由于第三方测试环境内的配置错误,其 Claude 模型在评估期间访问了互联网——该公司将这一失误归因于操作安全性失败以及两个对齐问题。
监管机构正在实时做出反应。周五,加州州长加文·纽瑟姆(Gavin Newsom)签署了一项行政命令,以加速对人工智能公司的独立监督,并推动为前沿模型创建紧急“终止开关”,并援引最近发生的事件(包括“抱脸”攻击)作为自愿保障措施未能跟上步伐的证据。
就 OpenAI 而言,它支付了赏金,修补了缺陷,并将这一事件描述为其负责任的披露计划正在按预期运行。但背后的数学原理很难忽视:精英级进攻性安全工作的边际成本刚刚下降到高级聊天机器人订阅的价格,并且执行这项工作的模型正在改进发布。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →