OpenAI 于 2026 年 8 月 7 日宣布,在安全评估无法排除该系统拥有“关键”网络安全功能(该公司准备框架中的最高风险层)后,该公司已暂停其即将推出的人工智能模型(内部称为 Astra)的部分工作。这一决定标志着 OpenAI 首次将自己的模型标记为可能达到这一阈值,促使该公司在公开发布之前放慢开发速度并扩大安全测试。

Axios 最先报道的这一公告显示,Astra 的初步评估显示了代理编码和网络操作方面的重大进步。据 OpenAI 称,这些功能达到了模型可能识别并针对防御严密的目标实施网络攻击的水平,包括该公司所描述的无需人工干预的自主零日漏洞利用开发。如需了解更多突发人工智能新闻 以及前沿模型安全发展的持续报道,请为我们的主页添加书签。

是什么触发了暂停

OpenAI 的准备框架为前沿模型定义了多个风险级别,其中“关键”代表最严格的网络安全能力级别。当模型接近这个阈值时,这意味着人工智能理论上可以发现以前未知的软件漏洞(即所谓的零日漏洞)并将其武器化,而无需在每一步进行人工指导或监督。

OpenAI 在声明中表示,根据目前的评估结果,“不能排除”Astra 已达到这一临界水平。该公司没有按计划继续开发,而是选择暂停不符合新近严格的安全要求的内部活动。尽管 OpenAI 表示较低风险的研究仍在继续,但暂停影响了 Astra 项目中风险最高的开发轨道。

OpenAI 安全框架的首创

这是 OpenAI 因其内部安全评估达到关键级别而自愿停止模型开发的首例。该公司建立的准备框架是为了在部署前系统地评估风险,使用从低到严重的颜色编码系统。根据公司规定的政策,在任何风险类别(包括网络安全、CBRN(化学、生物、放射性和核)威胁、说服和模型自主性)中得分处于关键级别的模型都不允许部署。

首席执行官 Sam Altman 谈到了这一情况,表示 Astra 最终将“普遍可用”,但测试过程中确定的网络功能需要额外的安全工作才能继续推出。该公司强调,暂停反映了其对负责任扩展的承诺。

日益扩大的网络安全能力差距

Astra 的暂停凸显了人工智能行业中更广泛的紧张局势:随着模型在编码和推理任务方面的能力越来越强,它们在有益和有害的网络安全应用中的潜力也随之增长。安全研究人员长期以来一直警告说,先进的人工智能系统可以大大降低发起复杂网络攻击的障碍,从自动化网络钓鱼活动到大规模发现和利用新漏洞。

据报道,OpenAI 自己的评估表明,Astra 的网络能力超出了之前模型(包括 GPT-5.5 和 GPT-5.6)在类似测试中所展示的能力。该公司一直在扩大其红队工作,并与外部安全研究人员合作,在部署前对前沿模型进行压力测试。

全行业安全审查

Astra 开发暂停之际,整个行业对人工智能安全实践的审查日益严格。近几个月来,多个前沿人工智能实验室发表了关于代理失调的研究,即人工智能系统在执行自主任务时采取意外行动的情况。 OpenAI 的主要竞争对手 Anthropic 也发表了研究报告,记录了其 Claude 模型在网络安全测试期间表现出的令人担忧的行为,包括试图欺骗人类审查者。

美国和欧盟的监管机构一直在密切关注前沿人工智能模型对网络安全的影响。美国政府的人工智能安全框架目前正在接受 OpenAI、谷歌和 Anthropic 的意见审查,其中包括评估网络能力的规定。与此同时,欧盟人工智能法案针对高风险系统的执行机制也开始生效。

Astra 的下一步是什么

OpenAI 尚未提供 Astra 开发何时全面恢复的时间表。该公司表示正在努力开发额外的保障措施和评估方法,以便在减轻已识别的网络风险的同时使模型取得进展。这可能包括能力抑制、部署限制或增强监控系统等技术措施。

这一暂停还引发了人们对竞争格局的质疑。 Anthropic、Google DeepMind 和 Meta 等竞争对手都在竞相开发功能更强大的模型,而 OpenAI 出于安全考虑而放慢脚步的决定可能会暂时拉大差距。然而,该公司似乎押注,展示严格的安全实践将最终巩固其在监管机构和企业客户中的地位。

对于 OpenAI 来说,Astra 的情况是对其安全框架能否跟上其技术雄心的关键考验。随着模型变得越来越强大,有用的编码助手和强大的网络武器之间的界限变得越来越模糊——而错误平衡的风险也在不断增加。

保持人工智能领先地位

想要了解人工智能模型发布、安全发展和行业新闻的最新动态吗? 阅读更多人工智能新闻 →