Microsoft Research は、自律 AI エージェントを構築、トレーニング、評価するためのオープンソース フレームワークである Orchard をリリースしました。これにより、比較的小さなオープンウェイト モデルがサイズの 10 倍以上のフロンティア システムのパフォーマンスに近づくことができると同社は述べています。 2026 年 8 月 3 日のブログ投稿で詳述されているこのプロジェクトは、これまで主に独自の研究室内に閉じ込められていた種類のインフラストラクチャをより広範な研究コミュニティに提供するという、同社のこれまでで最も野心的な取り組みです。

このリリースは、AI 業界が静的な質問応答から、複数ステップの環境にわたって計画、推論、および行動できるエージェントに移行する中で行われました。この分野が自律システムにどのように移行しているかについて詳しくは、最新の AI 業界報道をご覧ください。

オーチャードとは実際には何ですか

プロジェクトの中心となるのは、エージェントを大規模に実行するための再利用可能な分離されたコンポーネントを提供する軽量の Kubernetes ベースの環境サービスである Orchard Env です。 Microsoft によると、同じサービスはソフトウェア エンジニアリング エージェント、Web ブラウジング エージェント、およびパーソナル アシスタント エージェントを変更することなくサポートできます。トレーニング データの収集から強化学習のロールアウトと評価まで、すべてを処理します。

アーキテクチャ上の重要な決定は、ランタイム環境が特定のトレーニング フレームワーク内に組み込まれたインフラストラクチャではなく、スタンドアロンの再利用可能なサービスとして扱われることです。 Orchard Env は Kubernetes 上にあるため、数千の分離されたコンテナーを並行して作成、管理、削除できます。チームは、基盤となるインフラストラクチャを最初から再構築することなく、新しいベンチマーク、エージェント システム、トレーニング アルゴリズムを導入できます。

本物のハーネス内でのトレーニング

Orchard の際立った機能の 1 つは、実稼働環境で実際に使用する展開ハーネス内でエージェントを直接トレーニングできることです。今日の最も有能なエージェントがベア モデルとして実行されることはほとんどありません。これらは、マルチターン推論、ツールの使用、外部システムへの接続を管理する Codex、OpenClaw、ZeroClaw などの高度なハーネスを通じて動作します。

オープン トレーニング ツールは通常、こうしたステートフルなマルチプロセス ハーネスを処理できないため、研究者は簡略化された代役でトレーニングしてから実際の環境に展開する必要があり、トレーニングと展開の間に不一致が生じます。 Orchard はこのギャップを埋めます。軽量プロキシはハーネス独自のモデル呼び出しをトレーニング データとして記録し、各ロールアウトは独自のコンテナ内で実行されます。これにより、実稼働環境で使用するハーネス内でエージェントを直接エンドツーエンドでトレーニングできるようになります。

3 つのドメイン固有のレシピ

このアプローチを実証するために、Microsoft は 3 つのトレーニング ワークフローをリリースしました。

Orchard-SWE: ソフトウェア エンジニアリング

Orchard-SWE は、自律エージェントにとって最も要求の厳しい設定の 1 つである、実際のコードベースに対する複数ステップの推論を対象としています。これは Mini-SWE-Agent フレームワークを使用して構築され、現実世界のコードベースをナビゲート、診断、修復するモデルの能力をテストするベンチマークである SWE-bench Verified で評価されました。

システムをトレーニングするために、Microsoft は 2 つの高度なオープンウェイト モデル、MiniMax-M2.5 と Qwen3.5-397B から 107,000 のエージェント インタラクションを抽出し、GitHub の幅広い問題をカバーしました。クレジット割り当て監視付き微調整と呼ばれる手法を使用して、システムは部分的な試行のうちの生産的な部分を完全に破棄するのではなく、そこから学習します。

その結果、モデルは SWE ベンチ検証済みのベースラインの 61.4% から、強化学習では 69.1%、高密度報酬手法では 69.7% に上昇しました。値モデルの再ランキングにより、この数字は 73.0% に達します。これは、約 30 億のアクティブなパラメーターのみを使用し、同等のサイズのオープンソース モデルの中で最新技術です。

Orchard-GUI: Web ナビゲーション

Orchard-GUI は、40 億パラメータのビジョン言語モデルをブラウザ エージェントとしてトレーニングします。比較的少量の監視(400 の抽出されたデモンストレーションと 2,200 のオープンエンド トレーニング タスクを組み合わせた)を使用したにもかかわらず、モデルは WebVoyager で 74.1%、Online-Mind2Web で 67.0%、DeepShop で 64.0% の平均 68.4% を達成しました。 Microsoft は、これらの結果により、同社はこれまでで最も強力なオープンソース Web エージェントの 1 つに入ると述べています。

Orchard-Claw: パーソナル アシスタントのタスク

Orchard-Claw は、メールの読み取りと下書き、カレンダーの管理、情報の検索などの日常の生産性タスクに重点を置いています。わずか 200 の合成タスクでトレーニングされ、Claw-Eval ベンチマークで評価された結果、最大 3 回の試行でタスクの 59.6% を完了しましたが、より強力な ZeroClaw エージェント システムと組み合わせると 73.9% に上昇しました。

小規模モデルの結果が重要な理由

ベンチマークの数値が注目に値するのは、これらの数値が約 30 ~ 40 億のアクティブ パラメーターを持つモデルから得られたものであるためです。これは、リーダーボードを独占している OpenAI、Anthropic、Google のフロンティア システムよりもはるかに小さいものです。 Microsoft の主張は、適切なトレーニング インフラストラクチャと環境があればギャップの多くを埋められ、最大規模の独自モデルをトレーニングしたり実行したりする余裕がない研究者や組織でも有能なエージェント システムを利用できるようになる、というものです。

モデルとワークフローに加えて、Microsoft は、より広範な研究コミュニティによるオープン エージェント システムの構築と研究を支援するという明言された目標を掲げて、その構築に使用されるトレーニング データと評価方法をリリースしました。この研究は、Microsoft Research の Baolin Peng、Wenlin Yao、Qianhui Wu、Hao Cheng、Jianfeng Gao が主導しました。

AI の先を行く

Microsoft の Orchard リリースは、フロンティア エージェント AI の背後にあるインフラストラクチャが民主化され始めていることを示しています。続きを読む AI ニュース速報 および AI ニュースをもっと読む →