Microsoft Research heeft Orchard uitgebracht, een open source-framework voor het bouwen, trainen en evalueren van autonome AI-agents waarvan het bedrijf zegt dat het relatief kleine open-weight-modellen de prestaties van frontier-systemen laat benaderen die meer dan tien keer zo groot zijn. Het project, beschreven in een blogpost op 3 augustus 2026, is het meest ambitieuze poging van het bedrijf tot nu toe om de bredere onderzoeksgemeenschap het soort infrastructuur te bieden dat tot nu toe grotendeels opgesloten is gebleven in eigen laboratoria.

De release komt op het moment dat de AI-industrie verschuift van het statisch beantwoorden van vragen naar agenten die kunnen plannen, redeneren en handelen in omgevingen met meerdere stappen. Voor meer informatie over hoe het veld zich ontwikkelt in de richting van autonome systemen, zie onze [laatste berichtgeving over de AI-industrie] (https://aibuzzwire.news).

Wat Orchard eigenlijk is

Centraal in het project staat Orchard Env, een lichtgewicht, op Kubernetes gebaseerde omgevingsservice die herbruikbare, geïsoleerde componenten biedt voor het op grote schaal uitvoeren van agents. Volgens Microsoft kan dezelfde service zonder aanpassingen software-engineeringagents, webbrowseragents en persoonlijke assistent-agents ondersteunen. Het regelt alles, van het verzamelen van trainingsgegevens tot het uitrollen en evalueren van versterkend leren.

De belangrijkste architectonische beslissing is dat de runtime-omgeving wordt behandeld als een op zichzelf staande, herbruikbare service in plaats van een infrastructuur die is ingebed in een specifiek trainingsframework. Omdat Orchard Env op Kubernetes zit, kan het duizenden geïsoleerde containers parallel creëren, beheren en verwijderen. Teams kunnen nieuwe benchmarks, agentsystemen of trainingsalgoritmen introduceren zonder de onderliggende infrastructuur helemaal opnieuw op te bouwen.

Trainen in echte harnassen

Een van de onderscheidende kenmerken van Orchard is de mogelijkheid om agenten rechtstreeks op te leiden in de inzetharnassen die ze daadwerkelijk in de productie zullen gebruiken. De meest capabele agenten van vandaag de dag fungeren zelden als naakt model. Ze werken via geavanceerde harnassen zoals Codex, OpenClaw en ZeroClaw die multi-turn redenering, gereedschapsgebruik en verbindingen met externe systemen beheren.

Open trainingstools kunnen deze stateful, multi-process harnassen doorgaans niet aan, waardoor onderzoekers worden gedwongen te trainen op een vereenvoudigde stand-in en vervolgens in de echte omgeving te implementeren, waardoor er een discrepantie ontstaat tussen training en inzet. Orchard dicht dit gat: een lichtgewicht proxy registreert de eigen modelaanroepen van het harnas als trainingsgegevens terwijl elke uitrol in zijn eigen container plaatsvindt, waardoor een agent end-to-end rechtstreeks kan worden getraind in het harnas dat hij in de productie zal gebruiken.

Drie domeinspecifieke recepten

Om de aanpak te demonstreren heeft Microsoft drie trainingsworkflows uitgebracht.

Orchard-SWE: software-engineering

Orchard-SWE richt zich op een van de meest veeleisende instellingen voor autonome agenten: redeneren in meerdere stappen over echte codebases. Het is gebouwd met behulp van het Mini-SWE-Agent-framework en geëvalueerd op SWE-bench Verified, een benchmark die het vermogen van een model test om door echte codebases te navigeren, een diagnose te stellen en deze te repareren.

Om het systeem te trainen heeft Microsoft 107.000 agentinteracties gedestilleerd uit twee geavanceerde open-weight-modellen, MiniMax-M2.5 en Qwen3.5-397B, die een breed scala aan GitHub-problemen bestrijken. Door gebruik te maken van een techniek die 'credit-assignment begeleide fine-tuning' wordt genoemd, leert het systeem van de productieve delen van gedeeltelijke pogingen in plaats van deze volledig weg te gooien.

De resultaten verplaatsen het model van een basislijn van 61,4% op SWE-bench Verified naar 69,1% met versterkend leren en 69,7% met technieken met hoge beloning. Met een herschikking van het waardemodel komt dit cijfer uit op 73,0% – een nieuwe stand van de techniek onder open-sourcemodellen van vergelijkbare omvang, die slechts ongeveer 3 miljard actieve parameters gebruiken.

Orchard-GUI: webnavigatie

Orchard-GUI traint een vision-taalmodel met 4 miljard parameters als browseragent. Ondanks het gebruik van een relatief kleine hoeveelheid supervisie – 400 gedestilleerde demonstraties gecombineerd met 2.200 trainingstaken met een open einde – behaalde het model 74,1% op WebVoyager, 67,0% op Online-Mind2Web en 64,0% op DeepShop, wat neerkomt op een gemiddelde van 68,4%. Microsoft zegt dat deze resultaten het tot een van de sterkste open-source webagents tot nu toe maken.

Orchard-Claw: persoonlijke assistent-taken

Orchard-Claw richt zich op dagelijkse productiviteitstaken zoals het lezen en opstellen van e-mails, het beheren van agenda's en het zoeken naar informatie. Getraind op slechts 200 synthetische taken en geëvalueerd op basis van de Claw-Eval-benchmark, voltooide het 59,6% van de taken na maximaal drie pogingen, oplopend tot 73,9% in combinatie met het sterkere ZeroClaw-agentsysteem.

Waarom de resultaten van kleine modellen ertoe doen

De benchmarkcijfers zijn opmerkelijk omdat ze afkomstig zijn van modellen met grofweg 3 tot 4 miljard actieve parameters – veel kleiner dan de grenssystemen van OpenAI, Anthropic en Google die de ranglijsten domineren. Het argument van Microsoft is dat de juiste trainingsinfrastructuur en -omgeving een groot deel van de kloof kunnen dichten, waardoor capabele agentische systemen toegankelijk worden voor onderzoekers en organisaties die het zich niet kunnen veroorloven om de grootste propriëtaire modellen te trainen of te gebruiken.

Naast de modellen en workflows heeft Microsoft de trainingsgegevens en evaluatiemethoden vrijgegeven die zijn gebruikt om ze te bouwen, met als doel de bredere onderzoeksgemeenschap te helpen bij het bouwen en bestuderen van open agentische systemen. Het werk werd geleid door Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng en Jianfeng Gao van Microsoft Research.

Blijf AI een stap voor

De Orchard-release van Microsoft geeft aan dat de infrastructuur achter grensverleggende AI begint te democratiseren. Lees meer breaking AI news en Lees meer AI news →