OpenAI 修复了三个缺陷,据称这可以解释一周来用户抱怨其最新前沿模型 GPT-6 Astra 自推出以来变得更加愚蠢的缺陷,并且它正在重新设置 Codex 订阅者的使用限制,作为某种道歉。该更新来自 Codex 产品负责人 Tibo Sottiaux,根据周六发布的更新,他表示团队与用户合作追踪故障,然后在当地时间午夜之前发布修复程序并完全重置使用情况。
此次承认结束了 OpenAI 所宣称的迄今为止最强大的模型的一段艰难历程。自从 Astra 在 9 月初广泛使用以来,X 上的开发人员一直在针对发布日的 Astra 和当前版本运行相同的提示,保持每个设置相同,并发布并排比较,似乎显示出一个悄悄削弱的模型。有关推动这场辩论的模型的更多信息,请参阅我们的最新人工智能发展 报道。
三个缺陷,命名为
根据 Sottiaux 的说法,第一个罪魁祸首是技能——为早期模型编写的提示文件,这些文件在 Astra 下过于频繁地触发,有时会阻止模型检查自己的工作。第二个是可选的上下文管理实验,可以使模型提前退出或回复过时的消息。该公司表示,在大约 4,000 至 5,000 名用户受到影响后,OpenAI 停止了该实验。
第三个缺陷涉及基础设施而不是模型本身:一些推理引擎配置不正确,并且通过它们路由的尾部流量的质量明显下降。 OpenAI 删除了这些引擎并进行了几次较小的修复。 Sottiaux 写道,该模型现在可以更准确地跟踪用户的最新消息,这是对 Astra 一直在回答用户已经跳过的问题的抱怨的认可。
开发人员已经继续前进
投诉在一周内不断增加。开发人员 Pranjal Paliwal 几天前曾赞扬过 Astra,他回去阅读了为他编写的代码,然后将结果称为倒退而不是进步。编码工具 Opencode 的开发者 Dax Raad 在 Astra 上的花费增加了一倍后,他的团队又回到了旧的 GPT-5.6 Sol,因为他认为 Astra 的缺点不值得花钱。一位论坛发帖者描述 Astra 现在在相同的任务上与 Sol 处于同一水平,并进行相同的重试。
并不是每个人都接受这种解读。一位以 Antikythera 名义撰写的匿名用户认为,该模型一直很懒惰,喜欢强调要点,而用户只是不再感到眼花缭乱。这种分歧体现了模型质量索赔是多么难以解决:相同的提示,不同的判决。
后台容量问题
质量行落地,而容量却影响了推出。根据用户报告,OpenAI 已经降低了 ChatGPT 重度用户的 Astra 使用限制,并暂停了新的 200 美元 Pro 订阅——Sottiaux 于 9 月 10 日以需求为由证实了这一举措。该模型的每百万输入代币的费用仍然为 10 美元,每百万输出代币的费用为 50 美元,这是 Sol 推出时收费的 2.5 倍。
还有一个令人不安的先例:这是两个月内第二个 OpenAI 旗舰招致付费用户同样的指控。 7 月份,用户表示 Sol 的顶级推理模式一夜之间就变得浅薄了。索蒂奥否认当时故意削弱它,同时证实该公司一直在尝试推理工作。 “模型变得更糟”接着“我们发现缺陷”的重复循环正在成为公司必须管理的模式——透明度有帮助,但稳定性也有帮助。
OpenAI 自己的建议:使用更少的护栏
除了修复之外,OpenAI 还发布了工程师 Eric Provencher 的迁移指南,这相当于一个违反直觉的建议:功能更强大的模型需要更少的人工操作。该指南称,过长的技能描述、一揽子阅读要求和严格的审批规则可能会阻碍 Astra 的发展。随着时间的推移堆积的指令可能会消耗上下文或导致模型过早停止工作。
Provencher 建议团队在切换模型时检查他们的技能、AGENTS.md 文件和任务提示,将指令与特定任务紧密联系起来,并明确定义工作何时完成——因为即使没有限制,Astra 也可能比 GPT-5.6 Sol 更早停止。在早期模型失控后锁定事物的团队应该重新审视这些规则:这篇文章认为,Astra 拥有更好的判断力,但它可以从字面上解释旧的限制,以至于当你希望它继续运行时它就会停止。
接下来会发生什么
使用重置为 Codex 订阅者提供了重新评估模型的机会,而 OpenAI 将观察其用户运行的相同并行测试。更深层次的问题是信任:那些在发布一周内看到旗舰产品降级的付费开发者现在拥有了书面解释、三个命名缺陷和重置,而且还有一个新的理由,可以根据发布之日对每个模型更新进行基准测试。
保持人工智能领先地位
模型启动、缺陷事后分析以及重塑软件工作的工具——每天都进行跟踪。
阅读更多人工智能新闻 →