Microsoft Research vydal Orchard, open-source framework pro vytváření, školení a hodnocení autonomních agentů AI, který podle společnosti umožňuje relativně malým modelům s otevřenou váhou přiblížit se výkonu hraničních systémů více než desetinásobku jejich velikosti. Projekt, podrobně popsaný v příspěvku na blogu 3. srpna 2026, je dosud nejambicióznější nabídkou společnosti poskytnout širší výzkumné komunitě takovou infrastrukturu, která až dosud zůstávala z velké části uzavřena v proprietárních laboratořích.

Vydání přichází v době, kdy se odvětví umělé inteligence posouvá od statického odpovídání na otázky směrem k agentům, kteří mohou plánovat, uvažovat a jednat napříč vícekrokovými prostředími. Další informace o tom, jak se pole posouvá směrem k autonomním systémům, najdete v našem [nejnovějším pokrytí odvětví AI] (https://aibuzzwire.news).

Co Orchard vlastně je

Středobodem projektu je Orchard Env, odlehčená služba prostředí založená na Kubernetes, která poskytuje opakovaně použitelné izolované komponenty pro běh agentů ve velkém měřítku. Podle společnosti Microsoft může stejná služba podporovat agenty softwarového inženýrství, agenty pro procházení webu a agenty osobního asistenta bez úprav. Zvládá vše od shromažďování školicích dat až po zavedení a vyhodnocení posilovacího učení.

Klíčovým architektonickým rozhodnutím je, že běhové prostředí je považováno za samostatnou, opakovaně použitelnou službu, nikoli za infrastrukturu zabudovanou do specifického školícího rámce. Protože Orchard Env sedí na Kubernetes, může paralelně vytvářet, spravovat a odstraňovat tisíce izolovaných kontejnerů. Týmy mohou zavádět nové benchmarky, systémy agentů nebo školicí algoritmy, aniž by museli znovu budovat základní infrastrukturu od nuly.

Trénink ve skutečných postrojích

Jedním z charakteristických rysů Orchard je jeho schopnost trénovat agenty přímo uvnitř postrojů pro nasazení, které budou skutečně používat ve výrobě. Dnešní nejschopnější agenti jen zřídka běží jako holý model. Fungují prostřednictvím sofistikovaných svazků, jako jsou Codex, OpenClaw a ZeroClaw, které spravují víceotáčkové uvažování, použití nástrojů a připojení k externím systémům.

Otevřené školicí nástroje obvykle nedokážou zvládnout tyto stavové, víceprocesové svazky, což nutí výzkumníky trénovat na zjednodušeném záskoku a poté je nasadit v reálném prostředí, což vytváří nesoulad mezi školením a nasazením. Orchard tuto mezeru uzavírá: odlehčený proxy zaznamenává volání vlastního modelu kabelového svazku jako trénovací data, zatímco každé zavedení běží ve vlastním kontejneru, což umožňuje, aby byl agent zaškolen od začátku do konce přímo ve svazku, který bude používat ve výrobě.

Tři recepty specifické pro doménu

K demonstraci tohoto přístupu společnost Microsoft vydala tři pracovní postupy školení.

Orchard-SWE: softwarové inženýrství

Orchard-SWE se zaměřuje na jedno z nejnáročnějších nastavení pro autonomní agenty: vícekrokové uvažování nad skutečnými kódovými základnami. Byl vytvořen pomocí rámce Mini-SWE-Agent a hodnocen na SWE-bench Verified, benchmarku, který testuje schopnost modelu navigovat, diagnostikovat a opravovat skutečné kódové základny.

Pro trénování systému Microsoft destiloval 107 000 interakcí agentů ze dvou pokročilých modelů s otevřenou váhou, MiniMax-M2.5 a Qwen3.5-397B, které pokrývají širokou škálu problémů GitHubu. Pomocí techniky zvané doladění pod dohledem přidělování kreditu se systém učí z produktivních částí dílčích pokusů, spíše než aby je zcela zavrhl.

Výsledky posouvají model z 61,4 % základní linie na SWE-bench Verified na 69,1 % s posilovacím učením a 69,7 % s technikami hustého odměňování. S přehodnocením hodnotového modelu toto číslo dosahuje 73,0 % – nový stav techniky mezi open source modely srovnatelné velikosti, využívající pouze asi 3 miliardy aktivních parametrů.

Orchard-GUI: webová navigace

Orchard-GUI trénuje model vizuálního jazyka se 4 miliardami parametrů jako agent prohlížeče. Navzdory použití relativně malého množství dohledu – 400 destilovaných ukázek v kombinaci s 2 200 otevřenými tréninkovými úkoly – dosáhl model 74,1 % na WebVoyager, 67,0 % na Online-Mind2Web a 64,0 % na DeepShopu, v průměru 68,4 %. Microsoft říká, že tyto výsledky jej řadí mezi dosud nejsilnější open-source webové agenty.

Orchard-Claw: úkoly osobního asistenta

Orchard-Claw se zaměřuje na každodenní úkoly produktivity, jako je čtení a psaní e-mailů, správa kalendářů a vyhledávání informací. Trénováno na pouhých 200 syntetických úlohách a vyhodnoceno v benchmarku Claw-Eval, dokončilo 59,6 % úloh na tři pokusy, což vzrostlo na 73,9 % při spárování se silnějším systémem ZeroClaw agentů.

Proč na výsledcích malých modelů záleží

Hodnoty benchmarků jsou pozoruhodné, protože pocházejí z modelů se zhruba 3 až 4 miliardami aktivních parametrů – mnohem menší než hraniční systémy od OpenAI, Anthropic a Google, které dominují žebříčkům. Argumentem Microsoftu je, že správná školicí infrastruktura a prostředí může zaplnit velkou část mezery a zpřístupnit schopné agentní systémy výzkumníkům a organizacím, které si nemohou dovolit školit nebo provozovat ty největší proprietární modely.

Spolu s modely a pracovními postupy společnost Microsoft zveřejnila školicí data a metody hodnocení používané k jejich sestavení s uvedeným cílem pomoci širší výzkumné komunitě vybudovat a studovat otevřené systémy agentů. Práci vedli Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng a Jianfeng Gao z Microsoft Research.

Udržujte si náskok před AI

Vydání společnosti Microsoft Orchard signalizuje, že infrastruktura za hraniční agentní AI se začíná demokratizovat. Přečtěte si další aktuální zprávy o AI a Přečtěte si další zprávy o AI →