据独立基准测试公司 Artificial Analysis 称,OpenAI 于 9 月 29 日发布了 GPT-6.1 Sol,在该模型首次亮相仅 7 天后就退役了 GPT-6 Sol。此次交换恰逢该公司的 DevDay 开发者大会,CNET 报道称,与会者可以立即开始使用 GPT-6.1 Sol,以及新推出的 Dots 代理和一系列订阅更改。

即使按照 2026 年的加速标准,为期 7 天的旗舰到旗舰更换也是不寻常的,基准测试说明了 OpenAI 为何行动如此迅速。为了持续报道模型发布、基准竞争以及其背后的价格战,AI Buzz Wire 跟踪发生的重要进展。

7 天内可测量的跳跃

Artificial Analysis 报告称,GPT-6.1 Sol 在公司智能指数上比 GPT-6 Sol 提高了 4 个点,比 GPT-5.6 Sol 提高了 5 个点,仅比 OpenAI 最强大的模型 GPT-6 Astra 低 1 个点。该公司的评估将推理、知识工作、数学和代理任务融合成一个比较分数。

分项分数显示收益集中在哪里。 GPT-6.1 Sol 在 AA-Briefcase v1.1 中提高了 4 点,在 GDPval-AA v2.1 中提高了 5 点,这两者都测试代理知识的工作。 Terminal-Bench 4.0 提升了 12 分,表明真实终端环境中的性能显着提高,而 Humanity's Last Exam 上升了 5 分,GDP.pdf 上升了 6 分。

对于任何使用模型进行研究的人来说,有一个数字很引人注目:AA-Omniscience 的准确性上升了 8 个百分点,而幻觉率从 60% 下降到 54%。从绝对值来看,这两个数字仍然很高,但行进方向对于工作流程很重要,因为自信的错误答案比没有答案更糟糕。

标价相同,实际更便宜

在定价方面,GPT-6.1 Sol 保持了 GPT-6 Sol 的价目表:每百万输入代币 2 美元,每百万输出代币 10 美元,但缓存读取折扣从 90% 上升到 95%。 Artificial Analysis 指出,GPT-6.1 Sol 针对代理工作负载的混合价格因此略低于 GPT-6 Sol,延续了自 GPT-6 Sol 以比 GPT-5.6 Sol 50% 的折扣推出时开始的有效降价趋势。

定价轨迹才是真实的故事。在两次发布的时间里,OpenAI 两次将其中端前沿产品线的有效成本大致减半,同时每次都提高了质量。

每项任务的成本:0.72 美元 vs 3.26 美元

每个任务的成本是与 GPT-6 Astra 的明显差距的地方。在最大努力下,Artificial Analysis 将 GPT-6.1 Sol 的每项智能指数任务定价为 0.72 美元,不到 GPT-6 Astra 3.26 美元的四分之一。与它的前身相比,节省了 31%(GPT-6 Sol 为 1.05 美元),而与 GPT-5.6 Sol 相比,节省了 64%(1.99 美元)。

据该公司称,GPT-6.1 Sol 的每一个努力水平都超出了成本效率帕累托前沿——这意味着对于给定的智能水平,它跟踪的模型中不存在更便宜的选择。代币效率情况更加复杂:在不同工作水平上,GPT-6.1 Sol 消耗的输出代币比 GPT-6 Sol 多大约 10% 到 30%,尽管一旦考虑到更高的智能,其低和中等工作量设置对于代币效率仍然是帕累托最优。在编码中,该模型在公司的编码代理指数上以最大努力比 GPT-6 Sol 获得了 3 分。

为什么 7 天周转很重要

DevDay 的更广泛的内容强化了同样的情况。 CNET 的报告围绕开发人员可以立即使用的三件事(GPT-6.1 Sol、Dots 代理和重新设计的订阅计划)构建了这次会议,而不是遥远的研究预览。向开发人员传达的信息是今天的可用性,而不是明天的可能性。

旗舰节奏的这种短暂信号表明,竞争约束已从训练运行转向训练后改进和服务基础设施。一周内发布的点级升级看起来更像是一个优化的检查点和一个新的价格表,而不是一个从头开始的基础模型,竞争对手的行为也是一样的:谷歌于 9 月 30 日发布了 Gemini 4 Argon,这是一个前沿模型,最初通过其 Fairwind 计划以同样的每百万代币 2/10 美元的价格接触到值得信赖的网络防御者。

对于开发人员来说,经过验证的数字可以得出三个实际结论。首先,具有大量缓存重用的代理工作负载可以立即受益于 95% 的缓存折扣。其次,预算应该在迁移之前对较高的输出代币消耗进行建模,因为即使模型考虑的时间更长,每个代币的价格也不会改变。第三,对于最后一点智能值得 4 倍成本溢价的任务来说,Astra 仍然是上限——GPT-6.1 Sol 的情况是,对于大多数工作来说,事实并非如此。

值得重复的警告是:这些数字来自一个独立的评估者,无论其方法多么严格,并且指数分数奖励特定的工作负载组合。工作负载要求较高的团队应在重新路由生产流量之前重新运行自己的评估。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →