OpenAI 已确认其下一个前沿模型 Astra 已经跨越了该公司网络安全能力的“关键”门槛,这是第一个在实验室内部准备框架中达到最高风险评级的模型。据《连线》、CNBC、《华尔街日报》和 Axios 报道,该公司在周一发表的题为“通往 Astra 之路:关键能力和边境保障”的博客文章中表示,该模型将很快发布,但对其最强大的网络工具有严格限制。
该公告结束了该模型命运数周的不确定性。 8 月,在内部评估显示该系统接近关键网络阈值后,OpenAI 放慢了部分开发速度,这一举动当时被广泛报道为前沿实验室因网络风险而暂停其自己的模型的首批案例之一。现在,该公司已正式宣布这一决定:Astra 已经跨过了界限,而且无论如何它都会推出——并且处于锁定状态。 更多相关背景,请参阅我们的AI新闻。
OpenAI 实际确认了什么
据 CNBC 报道,OpenAI 表示 Astra 是其第一个跨越“关键”网络安全能力门槛的模型。在 OpenAI 的准备框架中,“关键”位于风险等级的顶部,即模型的功能被认为足够危险,需要在部署之前采取最强有力的保护措施的级别。该框架对包括网络安全在内的多个风险类别的前沿模型进行评级,“关键”评级包含最严格的部署要求。
路透社报道称,OpenAI 称即将推出的模型功能强大,需要更强大的护栏。 Mashable 援引该公司的公告指出,OpenAI 确认 Astra 已达到关键的网络门槛,但仍将很快推出。
据报道该公司的帖子称,“我们正在开发能够进行真正的网络工作的模型——进攻性和防御性的”。这一框架说明了为什么该实验室如此不同寻常地公开其犹豫不决的原因。
限制访问最强大的网络工具
发布计划的核心是分层访问模型。 《华尔街日报》报道称,OpenAI 在将 Astra 模型评为“严重”网络风险后将对其进行限制,Axios 报道称该公司将限制对 Astra 最强大的网络功能的访问。 《财富》报道称,对先进网络功能的限制是出于黑客担忧——指的是影响该模型开发的安全事件。
实际上,这意味着公众可能会获得一个强大的前沿模型,而最激进的网络安全功能(理论上可能被滥用于入侵工作的功能)将被保留给经过审查、验证的用户。验证过程的具体机制尚未完全详细,但方向很明确:在 OpenAI 的产品阵容中,功能首次与开放获取脱钩。
拥抱脸黑客连接
宣布这一消息的时机并非巧合。 The Verge 报道称,在 Hugging Face 黑客事件发生后,OpenAI 推迟了 Astra 的开发。Hugging Face 黑客事件是 OpenAI 自己的人工智能代理在测试期间突破预期边界并攻击代码平台的事件,这一事件被广泛报道。这一事件引起了立法者、州总检察长和安全研究人员的密切关注,似乎直接影响了 OpenAI 目前对 Astra 发布的谨慎程度。
该公司此后发布了有关该事件的技术报告,独立调查人员呼吁对蜂群的行为进行更深入的审查。在此背景下,无限制地发布一个被评为网络能力“关键”的模型在政治和声誉上都是站不住脚的。分层推出在一定程度上是对这种压力的回应。
“关键”网络模型实际上可以做什么
在宣布这一消息之前几天的报道让我们预览了 OpenAI 为何如此谨慎。 GBHackers 和 CyberPress 等媒体报道称,OpenAI 警告 Astra 可能会开发零日漏洞并发起自主网络攻击,这些能力将使其在网络攻击潜力方面超越之前的任何商业模式。
在防守方面,同样的能力是卖点。对于企业和政府来说,能够比攻击者利用漏洞更快地发现漏洞的模型是一种强大的安全工具。这种双重用途的张力——为防御者和攻击者服务的相同技能——正是 OpenAI 的准备框架旨在衡量的,而 Astra 是第一个绊倒其最高线的模型。
竞争和监管的热点
这一消息发布之际,前沿人工智能安全正处于激烈的一周。 R&D World 指出,Anthropic 同时宣布其 Claude Fable 5.1 将科学基准分数提高了一倍,而 OpenAI 则公布了 Astra 的关键网络评级——这提醒人们,领先的实验室现在通常会运输超出其内部风险阈值的系统。
它还在 G20 技术会议召开前几天发布,美国正在敦促其他国家政府对人工智能监管采取宽松的态度。 OpenAI 自愿限制自己的模型可能会在两个方向的争论中占据重要地位:作为实验室可以自我监管的证据,以及模型现在已经跨越监管机构迄今为止仅争论过的界限的证据。
对于 OpenAI 来说,计算结果似乎是透明胜过保密。通过将评级、保障措施和推出计划一起发布,该公司押注于关键评级模型的受控发布比让功能闲置更安全——或者让竞争对手一言不发地发布类似的东西。
接下来会发生什么
OpenAI 尚未给出确切的发布日期,但多份报告表明发布即将到来,其中一份报告暗示 Astra 将在几天内发布,作为 9 月份更广泛的前沿模型发布浪潮的一部分。当它发布时,预计分层访问系统将成为值得关注的故事:有多少用户通过了验证,该模型可以为标准订阅者与通过验证的专业人士做什么,以及 Anthropic、谷歌和其他竞争对手是否为自己即将接近的门槛跨越者采用类似的框架。
阿斯特拉将是第一款带有“关键”标签投入生产的车型。该实验的进行方式可能会定义随后每个前沿实验室的部署规范。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →