Microsoft Research hat Orchard veröffentlicht, ein Open-Source-Framework zum Erstellen, Trainieren und Evaluieren autonomer KI-Agenten, mit dem nach Angaben des Unternehmens relativ kleine Open-Weight-Modelle die Leistung von Frontier-Systemen erreichen können, die mehr als zehnmal so groß sind. Das Projekt, das in einem Blogbeitrag vom 3. August 2026 detailliert beschrieben wurde, ist der bislang ehrgeizigste Versuch des Unternehmens, der breiteren Forschungsgemeinschaft die Art von Infrastruktur zur Verfügung zu stellen, die bisher weitgehend in proprietären Laboren eingeschlossen war.
Die Veröffentlichung erfolgt zu einem Zeitpunkt, an dem sich die KI-Branche von der statischen Beantwortung von Fragen hin zu Agenten verlagert, die in mehrstufigen Umgebungen planen, argumentieren und handeln können. Weitere Informationen zur Entwicklung hin zu autonomen Systemen finden Sie in unserer neuesten Berichterstattung über die KI-Branche.
Was Orchard eigentlich ist
Im Mittelpunkt des Projekts steht Orchard Env, ein leichter, Kubernetes-basierter Umgebungsdienst, der wiederverwendbare, isolierte Komponenten für die Ausführung von Agenten in großem Maßstab bereitstellt. Laut Microsoft kann derselbe Dienst Software-Engineering-Agenten, Web-Browsing-Agenten und Personal-Assistant-Agenten ohne Modifikation unterstützen. Es übernimmt alles von der Erfassung von Trainingsdaten bis hin zur Einführung und Auswertung von Reinforcement-Learning.
Die wichtigste architektonische Entscheidung besteht darin, dass die Laufzeitumgebung als eigenständiger, wiederverwendbarer Dienst behandelt wird und nicht als Infrastruktur, die in ein bestimmtes Trainingsframework eingebettet ist. Da Orchard Env auf Kubernetes basiert, kann es Tausende isolierter Container parallel erstellen, verwalten und entfernen. Teams können neue Benchmarks, Agentensysteme oder Trainingsalgorithmen einführen, ohne die zugrunde liegende Infrastruktur von Grund auf neu aufbauen zu müssen.
Training in echten Gurten
Eines der herausragenden Merkmale von Orchard ist die Fähigkeit, Agenten direkt in den Bereitstellungsumgebungen zu schulen, die sie tatsächlich in der Produktion verwenden werden. Die fähigsten Agenten von heute agieren selten als bloßes Vorbild. Sie arbeiten mit hochentwickelten Systemen wie Codex, OpenClaw und ZeroClaw, die das Multi-Turn-Argument, die Werkzeugnutzung und Verbindungen zu externen Systemen verwalten.
Offene Trainingstools können diese zustandsbehafteten Multiprozess-Systeme in der Regel nicht bewältigen, sodass Forscher dazu gezwungen werden, auf einem vereinfachten Ersatzgerät zu trainieren und es dann in der realen Umgebung bereitzustellen, was zu einer Diskrepanz zwischen Training und Bereitstellung führt. Orchard schließt diese Lücke: Ein leichtgewichtiger Proxy zeichnet die Modellaufrufe des Harness als Trainingsdaten auf, während jeder Rollout in einem eigenen Container ausgeführt wird, sodass ein Agent durchgängig direkt im Harness trainiert werden kann, den er in der Produktion verwenden wird.
Drei domänenspezifische Rezepte
Um den Ansatz zu demonstrieren, hat Microsoft drei Trainingsworkflows veröffentlicht.
Orchard-SWE: Softwareentwicklung
Orchard-SWE zielt auf eine der anspruchsvollsten Umgebungen für autonome Agenten ab: mehrstufiges Denken über reale Codebasen. Es wurde mit dem Mini-SWE-Agent-Framework erstellt und auf SWE-Bench Verified evaluiert, einem Benchmark, der die Fähigkeit eines Modells testet, reale Codebasen zu navigieren, zu diagnostizieren und zu reparieren.
Um das System zu trainieren, hat Microsoft 107.000 Agenteninteraktionen aus zwei fortschrittlichen Open-Weight-Modellen, MiniMax-M2.5 und Qwen3.5-397B, destilliert, die ein breites Spektrum an GitHub-Problemen abdecken. Mithilfe einer Technik namens „Credit-Assignment Supervised Fine-Tuning“ lernt das System aus den produktiven Teilen von Teilversuchen, anstatt sie vollständig zu verwerfen.
Die Ergebnisse verschieben das Modell von einem Ausgangswert von 61,4 % auf der SWE-Bench-Verifizierung auf 69,1 % mit Verstärkungslernen und 69,7 % mit Techniken mit dichter Belohnung. Mit der Neubewertung der Wertmodelle erreicht der Wert 73,0 % – ein neuer Stand der Technik unter Open-Source-Modellen vergleichbarer Größe, die nur etwa 3 Milliarden aktive Parameter verwenden.
Orchard-GUI: Webnavigation
Orchard-GUI trainiert ein Vision-Language-Modell mit 4 Milliarden Parametern als Browser-Agent. Trotz eines relativ geringen Umfangs an Aufsicht – 400 destillierte Demonstrationen kombiniert mit 2.200 offenen Trainingsaufgaben – erreichte das Modell 74,1 % auf WebVoyager, 67,0 % auf Online-Mind2Web und 64,0 % auf DeepShop, was einem Durchschnitt von 68,4 % entspricht. Laut Microsoft zählen diese Ergebnisse zu den bisher stärksten Open-Source-Webagenten.
Orchard-Claw: Persönliche Assistentenaufgaben
Orchard-Claw konzentriert sich auf alltägliche Produktivitätsaufgaben wie das Lesen und Verfassen von E-Mails, die Verwaltung von Kalendern und die Suche nach Informationen. An nur 200 synthetischen Aufgaben trainiert und anhand des Claw-Eval-Benchmarks bewertet, erledigte es bei bis zu drei Versuchen 59,6 % der Aufgaben und stieg in Kombination mit dem stärkeren ZeroClaw-Agentensystem auf 73,9 %.
Warum die Ergebnisse des kleinen Modells wichtig sind
Die Benchmark-Zahlen sind bemerkenswert, weil sie von Modellen mit etwa 3 bis 4 Milliarden aktiven Parametern stammen – weitaus kleiner als die Grenzsysteme von OpenAI, Anthropic und Google, die die Bestenlisten dominieren. Microsoft argumentiert, dass die richtige Trainingsinfrastruktur und -umgebung einen Großteil dieser Lücke schließen kann und leistungsstarke Agentensysteme für Forscher und Organisationen zugänglich macht, die es sich nicht leisten können, die größten proprietären Modelle zu trainieren oder auszuführen.
Neben den Modellen und Arbeitsabläufen veröffentlichte Microsoft die Trainingsdaten und Bewertungsmethoden, die zu ihrer Erstellung verwendet wurden, mit dem erklärten Ziel, der breiteren Forschungsgemeinschaft beim Aufbau und Studium offener Agentensysteme zu helfen. Die Arbeit wurde von Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng und Jianfeng Gao von Microsoft Research geleitet.
Bleiben Sie der KI immer einen Schritt voraus
Die Orchard-Veröffentlichung von Microsoft signalisiert, dass die Infrastruktur hinter der bahnbrechenden Agenten-KI beginnt, sich zu demokratisieren. Lesen Sie mehr aktuelle KI-Nachrichten und Weitere KI-Nachrichten lesen →
