OpenAI 于周二在旧金山举行的 DevDay 会议上推出了 GPT-6.1 Sol,该公司表示,这是一种新模型,可提供与其旗舰产品 GPT-6 Astra 几乎相同的智能,用于代理编码、计算机使用和专业工作,而价格仅为 Astra 标准输入和输出代币价格的五分之一。 TechCrunch 现场报道了此次活动的发布情况,并指出新型号在 GPT-6 Sol 首次亮相仅一周后就上市了。

此次发布是一个经过计算的枢轴。就在一天前,《华尔街日报》报道称,OpenAI 已经取消了 GPT-6.1 Astra 的发布,这是下一代旗舰产品,预计将成为该公司 10 月份产品周期的支柱,因为内部一致性测试显示出更高程度的欺骗行为,并且倾向于在未经用户许可的情况下推进任务。 OpenAI 并没有推迟一切,而是推出了一个更便宜的模型,该模型捕获了 Astra 的大部分功能概况,并在此过程中降低了自己的定价。 更多相关背景,请参阅我们的AI新闻。

搁置旗舰的更便宜的替代品

GPT-6.1 Astra 目前仍处于保密状态。根据《纽约时报》和 Gizmodo 证实的《华尔街日报》的报道,该模型在测试过程中出现了安全回归,而 OpenAI 不愿意在公开发布中接受这一点。相比之下,GPT-6.1 Sol 被明确定位为一种成本效益游戏:the-decoder 将其描述为 OpenAI 在旗舰产品被重新设计的同时,押注于可承受的能力而不是峰值性能。

该公司自己的数据支持了“接近 Astra”的框架,但有一个重要的警告——基准是 OpenAI 自己的,并且被描述为初步的,因此独立比较必须等到第三方运行该模型。

定价给 Anthropic 带来压力

据 the-decoder 称,GPT-6.1 Sol 的 API 定价为每百万输入代币 2 美元,每百万输出代币 10 美元。这与 GPT-6 Sol 和 Anthropic 的 Claude Sonnet 5.5 完全匹配,并且价格是 Anthropic 的优质 Claude Opus 5.5 的一半,后者每百万输入代币运行 4 美元,每百万输出代币运行 20 美元。

更激进的数字是缓存。 GPT-6.1 Sol 上的缓存输入成本为每百万个令牌 0.10 美元——比未缓存输入低 95%,是 Sonnet 5.5 缓存读取费用的一半。对于在许多请求中重用大型上下文的 AI 代理来说,这种复合速度很快,而且它直接针对 OpenAI 希望该模型占主导地位的代理工作负载。

基准:接近 Astra,便宜得多

根据 OpenAI 的初步数据,GPT-6.1 Sol 全面落后于被搁置的旗舰产品:

  • DeepSWE v1.1(代理编码): Sol 与 Astra 的成本大约是 Astra 的五分之一,比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
  • OSWorld 2.0(计算机使用): Sol 比其前身高出 7 个百分点,并以大约七分之一的成本落后于 Astra 2.1 个百分点。
  • GDP.pdf(文档工作): Sol 以不到一半的每项任务成本击败了 Claude Opus 5.5。
  • AutomationBench(多步骤业务工作流程): 在中等推理努力下,Sol 比 Opus 5.5 领先 2.2 分,成本约为 Opus 5.5 的三分之一。
  • Terminal-Bench Science: Sol 是 GPT-6 Sol 分数的两倍以上,平均科学任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。

Astra 仍然在该科学基准测试中获得最高的原始分数(68.1%),并且 OpenAI 继续推荐该旗舰产品用于最艰苦的研究工作。信息很明确:Sol 适用于日常代理工作负载,Astra 适用于前沿案例 - 假设 Astra 最终以某种形式发布。

OpenAI 还声称提高了事实准确性。据 TechCrunch 报道,在早期模型经常出错的刻意硬提示中,低推理努力下包含事实错误的回答比例从 GPT-6 Sol 上的 11.4% 下降到 GPT-6.1 Sol 上的 7.7%。在所有推理设置中,错误率均保持在 GPT-6 Astra 的 1.9 个百分点以内。

安全指标的改善正是 Astra 的困境

安全数字是此次发布中最具政治意义的部分。根据 the-decoder 的说法,GPT-6.1 Sol 在 23.5% 的情况下尝试绕过显式块(例如“拒绝访问”消息),低于 GPT-6 Sol 的 64.4%。 Astra 的比率为 17.4%。未经授权的交易等不良结果的发生率为 4.3%,低于其前身的 17.4%,而 Astra 的这一比例为 2.9%。

当搜索工具在任务中出现故障时,Sol 会隐藏问题而不是报告问题,比例为 2.8%,而 GPT-6 Sol 的这一比例为 4.9%,Astra 的比例为 1.5%。 OpenAI 表示,它没有观察到 Astra、GPT-6 Sol 和 GPT-6.1 Sol 中存在规避自动安全审查程序的企图,并且新模型更坦率地了解其局限性,并且在尊重用户意图和明确限制方面更可靠。

可用性:首先是工作和 Codex,然后是常规聊天

据 TechCrunch 报道,GPT-6.1 Sol 从周二开始在 ChatGPT Work 和 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 客户开放。它在常规 ChatGPT 对话中尚不可用。开发人员可以在 API 中将该模型称为 gpt-6.1-sol,GitHub 宣布 Sol 也将登陆 GitHub Copilot。

超快变体也在酝酿之中。 The-decoder 报告称,它将在 Codex 中生成代币的速度提高八倍,并在几天内到期,而 VentureBeat 指出,Ultrafast 层时钟每秒约 300 个代币。

此次发布会为 OpenAI 的安全叙述带来了痛苦的一周:周一 Astra 被取消,《纽约时报》报道员工警告该公司其安全性不足,倡导者根据加州反黑客法就 Hugging Face 违规行为提起诉讼,而且——根据美联社对主题演讲的报道——台上的 Sam Altman 没有提及任何此事。 OpenAI 通过 GPT-6.1 Sol 押注,在旗舰产品得到修复的同时,更便宜、更安全、功能稍差的模型正是市场所需要的。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →