Microsoft Research a lansat Orchard, un cadru open-source pentru construirea, instruirea și evaluarea agenților AI autonomi despre care compania spune că permite modelelor deschise relativ mici să se apropie de performanța sistemelor de frontieră de peste zece ori dimensiunea lor. Proiectul, detaliat într-o postare pe blog din 3 august 2026, este cea mai ambițioasă ofertă a companiei de până acum pentru a oferi comunității de cercetare mai largi tipul de infrastructură care, până acum, a rămas în mare parte blocată în laboratoarele proprietare.
Lansarea vine pe măsură ce industria AI trece de la răspunsurile statice la întrebări la agenți care pot planifica, raționa și acționa în medii cu mai mulți pași. Pentru mai multe despre modul în care domeniul se îndreaptă către sisteme autonome, consultați cea mai recentă acoperire a industriei AI.
Ce este de fapt Orchard
În centrul proiectului se află Orchard Env, un serviciu de mediu ușor, bazat pe Kubernetes, care oferă componente izolate și reutilizabile pentru rularea agenților la scară. Potrivit Microsoft, același serviciu poate suporta agenți de inginerie software, agenți de navigare web și agenți de asistență personală fără modificări. Se ocupă de orice, de la colectarea datelor de formare până la lansarea și evaluarea învățării prin consolidare.
Decizia arhitecturală cheie este că mediul de rulare este tratat ca un serviciu independent, reutilizabil, mai degrabă decât o infrastructură încorporată într-un cadru de instruire specific. Deoarece Orchard Env se află pe Kubernetes, poate crea, gestiona și elimina mii de containere izolate în paralel. Echipele pot introduce noi parametri de referință, sisteme de agenți sau algoritmi de antrenament fără a reconstrui infrastructura de bază de la zero.
Antrenament în hamurile reale
Una dintre caracteristicile distinctive ale Orchard este capacitatea sa de a antrena agenți direct în interiorul hamurilor de implementare pe care le vor folosi efectiv în producție. Cei mai capabili agenți din ziua de azi funcționează rareori ca un model simplu. Acestea funcționează prin hamuri sofisticate, cum ar fi Codex, OpenClaw și ZeroClaw, care gestionează raționamentul în mai multe ture, utilizarea instrumentelor și conexiunile la sisteme externe.
Instrumentele de instruire deschise, de obicei, nu pot gestiona aceste hamuri cu mai multe procese, forțând cercetătorii să se antreneze pe un suport simplificat și apoi să se desfășoare în mediul real, ceea ce creează o nepotrivire între instruire și implementare. Orchard reduce acest decalaj: un proxy ușor înregistrează apelurile la modelul cablajului ca date de antrenament, în timp ce fiecare lansare rulează în propriul container, permițând unui agent să fie instruit de la capăt la capăt direct în cablajul pe care îl va folosi în producție.
Trei rețete specifice domeniului
Pentru a demonstra abordarea, Microsoft a lansat trei fluxuri de lucru de formare.
Orchard-SWE: inginerie software
Orchard-SWE vizează una dintre cele mai solicitante setări pentru agenții autonomi: raționamentul în mai mulți pași pe baze de cod reale. A fost construit folosind cadrul Mini-SWE-Agent și evaluat pe SWE-bench Verified, un benchmark care testează capacitatea unui model de a naviga, diagnostica și repara bazele de cod din lumea reală.
Pentru a antrena sistemul, Microsoft a distilat 107.000 de interacțiuni cu agenți din două modele avansate cu greutate deschisă, MiniMax-M2.5 și Qwen3.5-397B, acoperind o gamă largă de probleme GitHub. Folosind o tehnică numită reglare fină supravegheată de atribuire de credite, sistemul învață din porțiunile productive ale încercărilor parțiale, mai degrabă decât să le elimine în întregime.
Rezultatele mută modelul de la o valoare de bază de 61,4% pe SWE-bench Verified la 69,1% cu învățare prin întărire și 69,7% cu tehnici de recompensă densă. Odată cu reclasificarea modelului valoric, cifra ajunge la 73,0% - o nouă stare a tehnicii printre modelele open-source de dimensiuni comparabile, folosind doar aproximativ 3 miliarde de parametri activi.
Orchard-GUI: navigare web
Orchard-GUI antrenează un model de limbaj vizual cu 4 miliarde de parametri ca agent de browser. În ciuda utilizării unei cantități relativ mici de supraveghere - 400 de demonstrații distilate combinate cu 2.200 de sarcini de formare deschise - modelul a obținut 74,1% pe WebVoyager, 67,0% pe Online-Mind2Web și 64,0% pe DeepShop, pentru o medie de 68,4%. Microsoft spune că aceste rezultate îl plasează printre cei mai puternici agenți web open-source până în prezent.
Orchard-Claw: sarcini de asistent personal
Orchard-Claw se concentrează pe sarcini de productivitate de zi cu zi, cum ar fi citirea și redactarea e-mailurilor, gestionarea calendarelor și căutarea de informații. Antrenat pe doar 200 de sarcini sintetice și evaluat pe criteriul de referință Claw-Eval, a finalizat 59,6% din sarcinile date până la trei încercări, crescând la 73,9% atunci când este asociat cu sistemul mai puternic de agenți ZeroClaw.
De ce contează rezultatele pentru modelele mici
Cifrele de referință sunt notabile deoarece provin de la modele cu aproximativ 3 până la 4 miliarde de parametri activi - mult mai mici decât sistemele de frontieră de la OpenAI, Anthropic și Google care domină clasamentele. Argumentul Microsoft este că infrastructura și mediul de instruire potrivite pot reduce o mare parte a decalajului, făcând sisteme agentice capabile accesibile cercetătorilor și organizațiilor care nu își pot permite să antreneze sau să ruleze cele mai mari modele proprietare.
Alături de modele și fluxuri de lucru, Microsoft a lansat datele de instruire și metodele de evaluare utilizate pentru a le construi, cu scopul declarat de a ajuta comunitatea de cercetare mai largă să construiască și să studieze sisteme agentice deschise. Lucrarea a fost condusă de Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng și Jianfeng Gao de la Microsoft Research.
Rămâi înaintea AI
Lansarea Microsoft Orchard semnalează că infrastructura din spatele AI agentic de frontieră începe să se democratizeze. Citiți mai multe știri de ultimă oră AI și Citește mai multe știri AI →
