微软研究院发布了 Orchard,这是一个用于构建、训练和评估自主人工智能代理的开源框架,该公司表示,该框架可以让相对较小的开放权重模型接近前沿系统的性能,其规模是其规模的十倍以上。该项目在 2026 年 8 月 3 日的博客文章中详细介绍,是该公司迄今为止最雄心勃勃的项目,目的是为更广泛的研究界提供迄今为止基本上仍被锁定在专有实验室内的基础设施。
该版本的发布正值人工智能行业从静态问答转向可以跨多步骤环境进行规划、推理和行动的代理。有关该领域如何向自主系统发展的更多信息,请参阅我们的最新的人工智能行业报道。
Orchard 到底是什么
该项目的核心是 Orchard Env,这是一种基于 Kubernetes 的轻量级环境服务,为大规模运行代理提供可重用、隔离的组件。据微软称,相同的服务无需修改即可支持软件工程代理、网络浏览代理和个人助理代理。它处理从收集训练数据到强化学习的推出和评估的所有事务。
关键的架构决策是将运行时环境视为独立的、可重用的服务,而不是嵌入特定训练框架内的基础设施。由于 Orchard Env 位于 Kubernetes 上,因此它可以并行创建、管理和删除数千个隔离容器。团队可以引入新的基准、代理系统或训练算法,而无需从头开始重建底层基础设施。
在真实安全带内进行训练
Orchard 的显着特征之一是它能够直接在代理在生产中实际使用的部署工具中对其进行培训。当今最有能力的代理很少以裸模型运行。它们通过 Codex、OpenClaw 和 ZeroClaw 等复杂的工具进行操作,管理多轮推理、工具使用以及与外部系统的连接。
开放训练工具通常无法处理这些有状态、多进程的工具,迫使研究人员在简化的替身上进行训练,然后在真实环境中进行部署,这会造成训练和部署之间的不匹配。 Orchard 弥补了这一差距:轻量级代理将线束自己的模型调用记录为训练数据,而每个部署都在自己的容器中运行,从而允许代理直接在将在生产中使用的线束中进行端到端训练。
三个特定领域的秘诀
为了演示该方法,微软发布了三个培训工作流程。
Orchard-SWE:软件工程
Orchard-SWE 针对自主代理最苛刻的设置之一:对真实代码库的多步推理。它是使用 Mini-SWE-Agent 框架构建的,并在 SWE-bench Verified 上进行评估,这是一个测试模型导航、诊断和修复实际代码库能力的基准。
为了训练该系统,微软从两个先进的开放权重模型 MiniMax-M2.5 和 Qwen3.5-397B 中提取了 107,000 次代理交互,涵盖了广泛的 GitHub 问题。使用一种称为信用分配监督微调的技术,系统从部分尝试的有效部分中学习,而不是完全丢弃它们。
结果使模型从 SWE-bench Verified 上的 61.4% 基线提高到强化学习的 69.1%,以及密集奖励技术的 69.7%。通过价值模型重新排名,该数字达到 73.0%,这是同等规模的开源模型中的最新技术水平,仅使用约 30 亿个活动参数。
Orchard-GUI:网页导航
Orchard-GUI 将 40 亿参数的视觉语言模型训练为浏览器代理。尽管使用相对少量的监督(400 个精炼演示加上 2,200 个开放式训练任务),该模型在 WebVoyager 上实现了 74.1%,在 Online-Mind2Web 上实现了 67.0%,在 DeepShop 上实现了 64.0%,平均为 68.4%。微软表示,这些结果使其跻身迄今为止最强大的开源网络代理之列。
Orchard-Claw:个人助理任务
Orchard-Claw 专注于日常生产力任务,例如阅读和起草电子邮件、管理日历和搜索信息。仅经过 200 个综合任务的训练并在 Claw-Eval 基准上进行评估,它在尝试 3 次的情况下完成了 59.6% 的任务,与更强大的 ZeroClaw 代理系统配合使用时,完成率上升到 73.9%。
为什么小模型结果很重要
基准数据之所以引人注目,是因为它们来自具有大约 3 至 40 亿个活动参数的模型,远小于 OpenAI、Anthropic 和 Google 主导排行榜的前沿系统。微软的观点是,正确的培训基础设施和环境可以弥补大部分差距,使无法负担培训或运行最大专有模型的研究人员和组织能够使用功能强大的代理系统。
除了模型和工作流程之外,微软还发布了用于构建它们的训练数据和评估方法,其既定目标是帮助更广泛的研究社区构建和研究开放代理系统。这项工作由微软研究院的彭宝林、姚文林、吴千惠、程浩和高剑锋领导。
保持人工智能领先地位
微软 Orchard 的发布标志着前沿代理人工智能背后的基础设施正在开始民主化。阅读更多突发人工智能新闻 和阅读更多人工智能新闻 →
