OpenAI 已将在其人工智能模型中发现“通用越狱”的奖励提高到 50,000 美元,是之前奖金的两倍多,这表明该公司认为某些类别的安全绕过行为严重到足以保证支付溢价。
OpenAI 于 2026 年 7 月 9 日宣布更新后的 Bio Bug Bounty 计划,要求安全研究人员找到能够普遍突破模型安全护栏的提示——绕过多个对话和上下文,而不是孤立的边缘情况。该计划专门针对与生物威胁相关的越狱,其中人工智能模型可能被迫提供有关制造危险病原体或武器的可行指导。
如需了解更多 AI 重大新闻和深入分析,请访问 AI Buzz Wire。
为什么是 50,000 美元?
赏金的增加反映出人们越来越担心前沿人工智能模型被告知不要做什么和坚定的用户实际上可以从中获取什么之间的差距。通用越狱尤其危险,因为与一次性的即时注入技巧不同,它代表了一种可以复制和共享的系统性弱点。
TechRepublic 7 月 10 日报道称,奖励增加之际,OpenAI 最强大的模型受到了更严格的审查。据《国家科技新闻》报道,特朗普政府此前要求 OpenAI 将其最新的网络模型仅限于精心挑选的经过审查的用户组发布,这反映出政府对前沿人工智能系统的攻击潜力的担忧。
英国机构发现人工智能网络能力正在加速发展
此次赏金公告恰逢英国人工智能安全研究所 (AISI) 发出严厉警告,该研究所自 2024 年以来一直在独立评估前沿模型的网络能力。
在 2026 年 4 月对 OpenAI 的 GPT-5.5 的评估中,AISI 发现该模型在专家级网络安全任务上实现了 71.4% 的通过率,是所有测试模型中最高的,超过了 Anthropic 的 Claude Mythos Preview 的 68.6%、GPT-5.4 的 52.4% 和 Opus 4.7 的 48.6%。
一项基准特别引人注目。 AISI 设计了一个自定义虚拟机逆向工程挑战,这是一项多步骤任务,要求攻击者构建自定义指令解码器、对身份验证器进行逆向工程并恢复有效密码。 Crystal Peak Security 的专家人类游戏测试员使用专业工具在大约 12 小时内解决了这一挑战。 GPT-5.5 在 10 分 22 秒内解决了这个问题,API 使用成本为 1.73 美元,且无需人工协助。
每隔几个月翻一番
在 2026 年 5 月发布的另一份分析中,AISI 发现,自 2024 年底以来,前沿人工智能模型可以自主完成的网络任务的长度每 4.7 个月就翻一番,比 2025 年 11 月估计的 8 个月增加了一倍。
AISI 写道:“目前的变化速度表明,人工智能网络能力转化为有形风险的潜力越来越大——英国组织在未来几个月需要应对这些风险。”
Claude Mythos Preview 和 GPT-5.5 均大幅超过之前的翻倍趋势,引发了一个问题:这一速度是否会变得更快。
通用越狱:最高风险
狭义越狱和通用越狱之间的区别至关重要。狭窄的越狱可能会欺骗模型在特定条件下产生单个不允许的响应。相比之下,通用越狱代表了模型安全架构中的根本性漏洞——一种能够可靠地绕过各种输入的护栏的方法。
OpenAI 决定为此类发现提供 50,000 美元,这表明该公司认为普遍越狱既罕见,足以值得巨额赏金,又危险,足以值得投资。如果恶意行为者在修补之前发现了生物威胁相关查询的通用越狱,那么后果可能会很严重。
该计划还具有透明度功能。通过邀请外部研究人员探索其模型,OpenAI 可以在漏洞被广泛利用之前识别并修复漏洞——只要奖金足够大,足以吸引所需的人才。
进攻与防守的竞赛
OpenAI 的赏金增加和 AISI 的能力评估等并行发展说明了当今人工智能安全的核心紧张局势。模型在网络任务方面的能力正在显着增强,它们可以完成的任务的时间范围每隔几个月就会翻一番。与此同时,公司正在竞相修补导致其模型危险的漏洞。
赏金和红队能否跟上加速能力曲线的步伐仍然是一个悬而未决的问题。但 50,000 美元的数字发出了一个明确的信号:OpenAI 认为威胁已经足够严重,愿意向任何能够证明漏洞存在的人支付高额费用。
保持人工智能领先地位
随着前沿模式变得越来越强大,安全护栏与试图打破安全护栏的人之间的战斗只会愈演愈烈。在 AI Buzz Wire 上跟踪最新进展。
在 AI Buzz Wire 上阅读更多人工智能行业报道。


