Ornith 团队发布了 Ornith-1.5,这是一个围绕一个不寻常想法构建的开放权重语言模型系列:该模型生成自己的训练任务,设计自己的支架,并在连续运行的循环中从自己的解决方案尝试中学习。根据该团队自己的评估,旗舰产品 Ornith-1.5-397B 在 Terminal-Bench 2.1 (Terminus-2) 上得分为 86.1,与 Anthropic 的 Claude Opus 4.8 的 85.0 分持平,领先于所有其他同等规模的开源型号。
该版本于本周在麻省理工学院许可下在 Ornith 博客和 Hugging Face 上发布,是开源人工智能竞赛中的最新一波攻势,该竞赛定期产生曾经被认为没有前沿实验室预算就不可能实现的结果。对于跟踪最新人工智能模型新闻的开发者和企业来说,其意义是双重的:与领先的封闭模型的基准对等,以及指出开放模型开发下一步发展方向的培训方案。
三种尺寸,一种配方
Ornith-1.5 提供三种配置:397B 参数专家混合旗舰、每个令牌仅激活 3B 参数的 35B MoE,以及带有量化“移动”变体的紧凑型 9B 密集模型,旨在直接在 iPhone 和 Android 设备上运行。这三款产品都可在 Hugging Face 上与 GGUF、MLX 和 NVFP4 版本一起使用,并且模型卡表明该系列是基于 Qwen3.5 MoE 架构构建的。
血统在这里很重要。今年早些时候发布的 Ornith-1.0 普及了代理编码的“自脚手架”方法,并悄然走红——其 9B GGUF 版本在 Hugging Face 上的下载量已超过 500 万次。 Ornith-1.5 将该框架从优化支架和部署扩展为完整的自我改进管道。
自我完善循环的解释
在传统的训练后流程中,强化学习针对一组固定的人工任务进行运行。相反,Ornith-1.5 让模型本身提出新任务,生成特定于任务的支架(用于解决问题的指令、工具和分解策略),然后生成由刚刚构建的支架评分的解决方案推出。使用 GRPO 将奖励传播回所有三个阶段,因此系统同时学习编写更好的任务、更好的支架和更好的解决方案。
任务生成奖励是设计的核心。每个提议的任务都根据三个乘法信号进行评分:有效性(脚手架是否正确执行和评估?)、前沿难度(模型的经验成功率是否接近大约 20% 的目标,保持任务具有挑战性但可学习?)和新颖性(它与之前生成的任务缓冲区中的所有内容是否有足够的不同?)。由于难度是根据模型自身当前的成功率来衡量的,因此课程会随着模型的改进而自动升级。
该团队还在评估过程中报告了明确的反黑客措施:从存储库图像中删除了 git 历史记录,因此模型无法恢复先前的解决方案,并且禁用网络访问以防止模型获取外部答案。所有结果均是五次独立运行的平均值。
数字
在代理编码方面,旗舰产品的自我报告结果在开源领域处于领先地位。在 Terminal-Bench 2.1 上运行 Terminus-2 线束时,Ornith-1.5-397B 的 86.1 优于 Claude Opus 4.8 (85.0)、DeepSeek-V4-Flash-0731 (82.7) 和 GLM-5.2 (81)。在通过 Claude Code 工具运行的同一基准测试中,Ornith-1.5 的得分为 85.2,而 Opus 4.8 的得分为 78.9。在 SWE-bench Verified 上,两者实际上并列,分别为 86.0 和 85.8,Kimi K3 略微领先,为 86.2。
在更难的代理套件上,差距会扩大。在 DeepSWE 上,Ornith-1.5-397B 得分为 56.0,领先于 GLM-5.2 的 46.2,但落后于 Opus 4.8 (59.0) 和 Kimi K3 (67.5)。最引人注目的跳跃是世代:Ornith-1.0 在 DeepSWE 上的得分仅为 8.0,这意味着新的迭代在同一基准系列的基础上实现了七倍的改进。
较小的模型讲述了自己的故事。 Ornith-1.5-35B-A3B,每个令牌仅激活 3B 参数,在 Terminal-Bench 2.1(克劳德代码)上得分为 68.5,而 Google 的 Gemma 4-31B 得分为 43.4,Meta 的 Muse Glimmer-30B 得分为 51.7,并在 SWE-bench Verified 上得分为 79.0。 9B 型号在 Terminal-Bench 2.1 上达到 47.0,在 SWE-bench Verified 上达到 70.6,在 GPQA Diamond 上达到 86.4,这些数字使手机级型号与桌面级竞争对手相差无几。
注意事项和背景
这些是开发人员运行的基准,而不是独立审核的结果,并且比较模型是由 Ornith 团队在其自己的工具设置下进行评估的。竞争对手的实验室也会针对不同的权衡进行调整; Kimi K3 在 DeepSWE 上的领先表明代理软件工作的前沿仍然存在争议。但该版本的全表透明度——五次运行平均值、发布的安全带配置、公开的安全措施——使得独立复制变得异常简单。
社区反响热烈。该发布公告在几个小时内就在 Hacker News 上吸引了超过一百个点,讨论的重点不再是基准声明,而是自我改进方法,一些评论者将其描述为递归式任务生成的更可信的开放实现之一。
对于开源生态系统来说,Ornith-1.5 的诞生恰逢中国实验室和西方独立团队的开放模型正在缩小与编码和代理任务的封闭边界之间的差距。麻省理工学院许可的系列与 Terminal-Bench 上领先的封闭模型相匹配,并推出了支持手机的 9B 变体,进一步缩小了差距,并采用任何人都可以检查、复制和扩展的训练方法。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →