Microsoft Research har släppt Orchard, ett ramverk med öppen källkod för att bygga, träna och utvärdera autonoma AI-agenter som företaget säger låter relativt små modeller med öppen vikt närma sig prestanda hos frontiersystem mer än tio gånger så stor. Projektet, som beskrivs i ett blogginlägg den 3 augusti 2026, är företagets hittills mest ambitiösa bud för att ge det bredare forskarsamhället den typ av infrastruktur som hittills till stor del har förblivit låst i egna laboratorier.

Utgåvan kommer när AI-branschen övergår från statisk frågesvar till agenter som kan planera, resonera och agera i flerstegsmiljöer. För mer om hur fältet rör sig mot autonoma system, se vår senaste AI-industribevakning.

Vad Orchard faktiskt är

I centrum för projektet är Orchard Env, en lätt, Kubernetes-baserad miljötjänst som tillhandahåller återanvändbara, isolerade komponenter för att köra agenter i stor skala. Enligt Microsoft kan samma tjänst stödja programvarutekniker, webbläsaragenter och personliga assistenter utan ändringar. Den hanterar allt från insamling av träningsdata till utrullning och utvärdering av förstärkningsinlärning.

Det viktigaste arkitektoniska beslutet är att körtidsmiljön behandlas som en fristående, återanvändbar tjänst snarare än infrastruktur inbäddad i ett specifikt utbildningsramverk. Eftersom Orchard Env sitter på Kubernetes kan den skapa, hantera och ta bort tusentals isolerade behållare parallellt. Team kan introducera nya riktmärken, agentsystem eller träningsalgoritmer utan att bygga om den underliggande infrastrukturen från grunden.

Träning i riktiga selar

En av Orchards utmärkande egenskaper är dess förmåga att utbilda agenter direkt inuti de utbyggnadsselar som de faktiskt kommer att använda i produktionen. Dagens mest kapabla agenter kör sällan som en bar modell. De fungerar genom sofistikerade selar som Codex, OpenClaw och ZeroClaw som hanterar resonemang med flera svängar, verktygsanvändning och anslutningar till externa system.

Öppna utbildningsverktyg kan vanligtvis inte hantera dessa statistiska, multi-process-selar, vilket tvingar forskare att träna på ett förenklat stand-in och sedan distribuera i den verkliga miljön, vilket skapar en oöverensstämmelse mellan utbildning och utplacering. Orchard täpper till detta gap: en lättviktsproxy registrerar selens egna modellanrop som träningsdata medan varje utrullning körs i sin egen container, vilket gör att en agent kan tränas från början till slut direkt i selen som den kommer att använda i produktionen.

Tre domänspecifika recept

För att demonstrera tillvägagångssättet släppte Microsoft tre utbildningsarbetsflöden.

Orchard-SWE: mjukvaruutveckling

Orchard-SWE riktar sig mot en av de mest krävande inställningarna för autonoma agenter: flerstegsresonemang över riktiga kodbaser. Den byggdes med Mini-SWE-Agent-ramverket och utvärderades på SWE-bench Verified, ett riktmärke som testar en modells förmåga att navigera, diagnostisera och reparera verkliga kodbaser.

För att träna systemet destillerade Microsoft 107 000 agentinteraktioner från två avancerade modeller med öppen vikt, MiniMax-M2.5 och Qwen3.5-397B, som täcker ett brett spektrum av GitHub-problem. Genom att använda en teknik som kallas kredituppdragsövervakad finjustering, lär sig systemet av de produktiva delarna av partiella försök snarare än att kassera dem helt.

Resultaten flyttar modellen från en 61,4 % baslinje på SWE-bench Verified till 69,1 % med förstärkningsinlärning och 69,7 % med tätbelöningstekniker. Med omplacering av värdemodeller når siffran 73,0 % - en ny toppmodern bland modeller med öppen källkod av jämförbar storlek, med endast cirka 3 miljarder aktiva parametrar.

Orchard-GUI: webbnavigering

Orchard-GUI tränar en vision-språkmodell med 4 miljarder parametrar som webbläsaragent. Trots att den använde en relativt liten mängd övervakning – 400 destillerade demonstrationer kombinerat med 2 200 öppna träningsuppgifter – uppnådde modellen 74,1 % på WebVoyager, 67,0 % på Online-Mind2Web och 64,0 % på DeepShop, för ett genomsnitt på 68,4 %. Microsoft säger att dessa resultat placerar den bland de starkaste webbagenterna med öppen källkod hittills.

Orchard-Claw: personliga assistentuppgifter

Orchard-Claw fokuserar på vardagliga produktivitetsuppgifter som att läsa och skriva e-postmeddelanden, hantera kalendrar och söka efter information. Utbildad på bara 200 syntetiska uppgifter och utvärderad enligt Claw-Eval benchmark, slutförde den 59,6 % av uppgifterna upp till tre försök, vilket steg till 73,9 % när den parades ihop med det starkare ZeroClaw-agentsystemet.

Varför småmodellresultaten är viktiga

Benchmarksiffrorna är anmärkningsvärda eftersom de kommer från modeller med ungefär 3 till 4 miljarder aktiva parametrar – mycket mindre än frontiersystemen från OpenAI, Anthropic och Google som dominerar topplistorna. Microsofts argument är att rätt utbildningsinfrastruktur och -miljö kan täppa till mycket av klyftan, vilket gör kapabla agentsystem tillgängliga för forskare och organisationer som inte har råd att träna eller köra de största proprietära modellerna.

Vid sidan av modellerna och arbetsflödena släppte Microsoft utbildningsdata och utvärderingsmetoder som användes för att bygga dem, med det uttalade målet att hjälpa det bredare forskarsamhället att bygga och studera öppna agentsystem. Arbetet leddes av Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng och Jianfeng Gao från Microsoft Research.

Ligg före AI

Microsofts Orchard-release signalerar att infrastrukturen bakom frontier agent AI börjar demokratisera. Läs mer brytande AI-nyheter och Läs mer AI-nyheter →