xAI 发布了 Grok 4.6,这是其前沿大语言模型的最新版本,在人工分析智能指数上得分为 61,与 OpenAI 的 GPT-5.6 Sol 相匹配。该模型已于今日发布,可立即在 Cursor 和 Grok Build 中使用,并可通过 OpenRouter、Vercel 和 Cloudflare 进行 API 访问和合作伙伴集成。
有关最新的 AI 重大新闻和分析,请访问 AI Buzz Wire。
以一小部分成本实现前沿情报
根据独立基准测试平台 Artificial Analysis 的数据,Grok 4.6 在智能指数上比其前身 Grok 4.5 提高了 5 个百分点,使 xAI 重新与 OpenAI 并列前沿。该模型仅次于 Anthropic 的 Claude Opus 5 (63) 和 Claude Fable 5 (62),领先于 Kimi K3。
Grok 4.6 特别引人注目的是它的定价。总体定价与 Grok 4.5 保持不变,为每百万输入代币 2 美元和每百万输出代币 6 美元。这使其比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60% 以上。每项任务的测量成本为 0.84 美元,位于智能与成本帕累托前沿。
在前沿领域,在一代人的时间里保持价格持平是不寻常的,因为情报的增长通常伴随着价格的上涨。 Grok 4.6 在价格不变的情况下实现了 5 个点的智能指数增益。
专为长时间运行的代理而构建
Grok 4.6 建立在 Grok 4.5 的基础上,xAI 将其描述为特别关注长期运行的代理和更雄心勃勃的交互式和视觉工作。该公司表示,该模型可以跨多个步骤处理复杂的任务,无论是研究主题、分析信息、跨代码库工作,还是将想法转化为精美的应用程序。
代理基准讲述了一个引人注目的故事。在 GDPval-AA v2(现实世界代理知识工作的领先衡量标准)上,Grok 4.6 的 Elo 为 1753,仅落后于 Claude Opus 5,在统计上与 Claude Fable 5 和 Qwen3.8 Max 相当。它在多轮客户服务的 tau 立方银行基准测试中得分为 50.7%,与 Qwen3.8 Max 一起位列前两名。
在 CursorBench v3.2 上,Grok 4.6 得分为 69.9%,领先于 GPT-5.6 Sol (67.2%) 和 Grok 4.5 (66.7%)。 DeepSWE v1.1 上的得分为 65.9%,FrontierCode v1.1 Extended 上的得分为 61.3%。
显着的转弯效率
人工分析的突出发现之一是 Grok 4.6 在 AA-Briefcase 上的效率概况,AA-Briefcase 是长期代理知识工作任务的私人基准。该模型首次亮相时的 Elo 为 1577,位于《神鬼寓言 5》级别。
效率数字是惊人的。 Grok 4.6 平均需要大约 53 个回合和 5 亿个输入令牌来解决任务,而 Claude Opus 5 max 则需要大约 103 个回合和 20 亿个输入令牌。由于长期代理工作会快速积累上下文,因此在一半的回合和四分之一的输入令牌中达到可比答案的模型具有远远超出其每个令牌定价的成本优势。
培训和安全
Grok 4.6 经历了比 Grok 4.5 更长的补充训练,具有用于推理和先进技术概念的精选模型生成数据、高质量的工程数据以及改进的优化器和训练配方。 xAI 使用 Grok 4.5 重新生成跨推理工作、代理工具以及 STEM、软件工程和知识工作等领域的 SFT 轨迹。
该模型带有 500,000 个 token 的上下文窗口,与 Grok 4.5 相比没有变化。 xAI 报告称,Grok 4.6 经历了有史以来最广泛的部署前功能测试和保障校准,以及广泛的部署后和第三方测试。
供货情况和定价
Grok 4.6 现已在 Cursor 和 Grok Build 中提供。 xAI 第一周在两个平台内提供双重包含使用。起价为每百万输入代币 2 美元,每百万输出代币 6 美元,快速版本的价格是其两倍。缓存命中折扣为每百万代币 0.50 美元。
xAI 的发布继续保持快速节奏,Grok 4.6 比 Grok 4.5 晚一个多月发布。该模型将 xAI 定位为前沿竞赛中的有力竞争者,特别是对于优先考虑代理性能和成本效率的开发人员而言。
保持人工智能领先地位
如需持续报道人工智能行业最重要的发展,请添加书签 AI Buzz Wire,不错过任何重大新闻。
阅读更多人工智能新闻