Devin AI 软件工程师背后的公司 Cognition 于周四推出了 SWE-2,将其描述为迄今为止最先进的编码模型。该公司在 9 月 10 日发布的一篇博客文章中表示,新模型推动了所谓的能力和成本帕累托前沿,在 FrontierCode 1.1 Main 基准测试中得分为 50.0%,而成本比 Fable 5.1 低 64%,而 Anthropic 模型仅领先它 1 个百分点(50.9%)。
就在 Cognition 确认以 480 亿美元估值完成 20 亿美元融资的一天后,该产品发布,这表明这家代理编码初创公司正在积极投资于自己的模型开发,而不是仅仅依赖第三方前沿模型。如需持续报道人工智能编码竞赛以及推动行业发展的其他一切,请添加书签 AI Buzz Wire,这是您每日获取突发人工智能新闻的来源。
SWE-2 的基准测试结果
根据 Cognition 公布的结果,SWE-2 在 FrontierCode 1.1 Main 上的得分为 50.0%,领先于 Grok 4.6(48.0%)和 GPT-5.6 Sol(47.5%),与领先的 GPT-6 Astra(53.3%)相差不远。在 DeepSWE 1.1 基准测试中,SWE-2 达到 73.0%,在模型 Cognition 排行榜中仅次于 Astra 的 74.1%。
最强劲的表现出现在 Terminal-Bench 2.1 上,其中 SWE-2 得分为 92.8%,是 Cognition 比较表中的最高数字,领先于 Fable 5.1 的 91.4% 和 GPT-6 Astra 的 89.9%。在较难的 Terminal-Bench 4 上,情况发生了变化,其中 SWE-2 的成功率为 27.3%,GPT-6 Astra 为 57.9%,Fable 5.1 为 55.8%,这提醒我们,该模型效率优先的设计在任务难度的最高端留下了空间。
Cognition 直截了当地总结了定位:在 FrontierCode 1.1 Main 和 DeepSWE 1.1 上,SWE-2 在分数和成本上都击败了之前的型号 SWE-1.7 和 Grok 4.6,以极低的价格与 GPT-5.6 Sol 和 Fable 5/5.1 相匹配,并且以四分之一的成本与 GPT-6 Astra 相差几分。
Kimi K3 数万亿规模的后期培训
SWE-2 并不是从头开始建造的。 Cognition 对 Kimi K3 的模型进行了后训练,Kimi K3 是 Moonshot AI 的 2.8 万亿参数基础模型,已经针对代理编码进行了广泛的强化学习。 Cognition 表示,在此基础上,其 RL 流程在许多基准测试中增加了 5 到 6 分,并改变了 K3 的整个性价比前沿。
该公司表示,SWE-2 是其首次将强化学习扩展到数万亿参数体系,建立在为 SWE-1.7 开发的培训基础设施和配方的基础上。关键的补充是强化学习算法,它可以在一次运行中训练所有推理努力水平,而不是将低、中和高努力视为单独的训练目标。
成本惩罚塑造整个前沿
SWE-2 训练的中心思想是在单次 RL 运行中针对每个努力级别应用线性成本惩罚,每个惩罚都根据基本模型帕累托前沿的局部斜率进行调整。 Cognition 表示,这种源自第一原理的方法推进了模型的整个性价比前沿,同时保持其形状并在训练中尽可能直接地反映真实的用户成本。
该公司还详细介绍了自 SWE-1.6 以来一直使用的长度加权奖励基线,该基线被认为可以显着稳定训练,同时还改进了 RL 推出服务,其中包括用于提高解码吞吐量的在线草稿模型。 Cognition 表示,通过 NVFP4 和 FP8 内核以及量化感知训练,尽管基本模型的参数几乎是其前身的三倍,但它减少了总体内存使用量。
训练数据管道也得到了扩展:Cognition 将 RL 环境的数量增加了两倍,添加了指令跟踪覆盖,并构建了一个由之前的 SWE-2 检查点驱动的飞轮,迭代地强化了用于对模型进行评分的验证器。
效率与智能同样重要
认知将 SWE-2 的收益视为与效率密切相关。该公司表示,更强的工程判断力可以让代理编写更完整的解决方案,减少弯路和冗余读取。在 FrontierCode 1.1 Main 上,SWE-2 的中等强度配置得分高于 SWE-1.7,同时轮数减少 58%,成本降低 81%。
这个框架对于 Cognition 的业务很重要。 Devin 以自主软件工程师的身份出售,推理成本是定价和利润的直接输入。在保持前沿质量的同时减少每项任务的轮次和代币的模型改变了该公司服务的每个 Devin 会话的经济性。
可用性
据该公司称,SWE-2 即日起在 Devin Desktop 和 Devin CLI 中提供,并正在 Devin Web 和 Fusion 上推出。 Cognition 表示,用户应该会在未来几天内看到该模型出现在各个表面上。
这对编码模型市场意味着什么
这次发布使 GPT-6 Astra 背后已经很拥挤的群体变得更加紧张。 Cognition 现在拥有一个模型,可以以明显更低的成本与 Anthropic、OpenAI 和 xAI 的产品相媲美,并且它控制着从模型到代理产品的整个堆栈。竞争对手将面临在价格和能力上做出回应的压力,特别是对于 SWE-2 成本状况最强的大批量、中等难度的任务。
对于人工智能编码工具的购买者来说,实际的收获是前沿级编码帮助不再需要前沿级定价。对于行业的其他公司来说,SWE-2 证明训练后和基础设施效率(而不仅仅是基础模型规模)已成为决定性的竞争杠杆。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →