Firma Microsoft Research udostępniła Orchard, platformę typu open source do budowania, szkolenia i oceniania autonomicznych agentów AI, która według firmy pozwala stosunkowo małym modelom o otwartej wadze osiągnąć wydajność systemów granicznych ponad dziesięciokrotnie większą. Projekt, szczegółowo opisany w poście na blogu z 3 sierpnia 2026 r., to najambitniejsze jak dotąd przedsięwzięcie firmy mające na celu udostępnienie szerszej społeczności badawczej infrastruktury, która do tej pory w dużej mierze pozostawała zamknięta w zastrzeżonych laboratoriach.
Wydanie pojawia się w momencie, gdy branża sztucznej inteligencji odchodzi od statycznego odpowiadania na pytania w kierunku agentów, którzy potrafią planować, rozumować i działać w wieloetapowych środowiskach. Więcej informacji na temat kierunku zmierzającego w stronę systemów autonomicznych można znaleźć w naszym najnowszym raporcie z branży sztucznej inteligencji.
Czym właściwie jest Sad
Sercem projektu jest Orchard Env, lekka usługa środowiskowa oparta na Kubernetes, która zapewnia izolowane komponenty wielokrotnego użytku do uruchamiania agentów na dużą skalę. Według Microsoftu ta sama usługa może bez modyfikacji obsługiwać agentów zajmujących się inżynierią oprogramowania, agentów przeglądania stron internetowych i agentów asystentów osobistych. Zajmuje się wszystkim, od gromadzenia danych szkoleniowych po wdrażanie i ocenę uczenia się przez wzmacnianie.
Kluczową decyzją dotyczącą architektury jest traktowanie środowiska wykonawczego jako samodzielnej usługi wielokrotnego użytku, a nie infrastruktury wbudowanej w określoną strukturę szkoleniową. Ponieważ Orchard Env działa na platformie Kubernetes, może równolegle tworzyć, zarządzać i usuwać tysiące izolowanych kontenerów. Zespoły mogą wprowadzać nowe testy porównawcze, systemy agentów lub algorytmy szkoleniowe bez konieczności przebudowywania podstawowej infrastruktury od zera.
Trening w prawdziwych uprzężach
Jedną z wyróżniających cech Orchard jest jego zdolność do szkolenia agentów bezpośrednio w ramach uprzęży wdrożeniowych, których będą faktycznie używać w produkcji. Dzisiejsi najzdolniejsi agenci rzadko działają jako goły model. Działają poprzez zaawansowane uprzęże, takie jak Codex, OpenClaw i ZeroClaw, które zarządzają rozumowaniem wieloobrotowym, wykorzystaniem narzędzi i połączeniami z systemami zewnętrznymi.
Otwarte narzędzia szkoleniowe zwykle nie są w stanie obsłużyć takich stanowych, wieloprocesowych wiązek, co zmusza badaczy do szkolenia na uproszczonym zastępstwie, a następnie wdrożenia w rzeczywistych warunkach, co powoduje rozbieżność między szkoleniem a wdrożeniem. Orchard wypełnia tę lukę: lekki serwer proxy rejestruje wywołania własnego modelu uprzęży jako dane szkoleniowe, podczas gdy każde wdrożenie przebiega we własnym kontenerze, umożliwiając kompleksowe przeszkolenie agenta bezpośrednio w uprzęży, której będzie używać w produkcji.
Trzy przepisy specyficzne dla domeny
Aby zademonstrować to podejście, firma Microsoft udostępniła trzy przepływy pracy szkoleniowej.
Orchard-SWE: inżynieria oprogramowania
Orchard-SWE koncentruje się na jednym z najbardziej wymagających ustawień dla agentów autonomicznych: wieloetapowym rozumowaniu na podstawie rzeczywistych baz kodu. Został zbudowany przy użyciu platformy Mini-SWE-Agent i oceniony w SWE-bench Verified, benchmarku testującym zdolność modelu do nawigacji, diagnozowania i naprawiania baz kodu w świecie rzeczywistym.
Aby wytrenować system, Microsoft wyodrębnił 107 000 interakcji agentów z dwóch zaawansowanych modeli o otwartej wadze, MiniMax-M2.5 i Qwen3.5-397B, obejmujących szeroki zakres problemów z GitHubem. Stosując technikę zwaną dostrajaniem nadzorowanym przy przypisywaniu punktów, system uczy się na produktywnych fragmentach częściowych prób, zamiast je całkowicie odrzucać.
Wyniki przesuwają model z wartości bazowej wynoszącej 61,4% w przypadku analizy SWE-bench Verified do 69,1% w przypadku uczenia się przez wzmacnianie i 69,7% w przypadku technik gęstej nagrody. Po zmianie rankingu modelu wartości liczba ta sięga 73,0%, co stanowi nowy stan wiedzy wśród modeli open source o porównywalnej wielkości, wykorzystujących jedynie około 3 miliardy aktywnych parametrów.
Orchard-GUI: nawigacja internetowa
Orchard-GUI uczy 4-miliardowego modelu języka wizyjnego jako agenta przeglądarki. Pomimo stosowania stosunkowo niewielkiej liczby superwizji — 400 destylowanych demonstracji w połączeniu z 2200 otwartymi zadaniami szkoleniowymi — model osiągnął 74,1% w przypadku WebVoyager, 67,0% w Online-Mind2Web i 64,0% w DeepShop, średnio 68,4%. Microsoft twierdzi, że te wyniki plasują go wśród najsilniejszych dotychczas agentów internetowych typu open source.
Orchard-Claw: zadania osobistego asystenta
Orchard-Claw koncentruje się na codziennych zadaniach związanych z produktywnością, takich jak czytanie i tworzenie e-maili, zarządzanie kalendarzami i wyszukiwanie informacji. Wytrenowany w zaledwie 200 zadaniach syntetycznych i oceniony w teście porównawczym Claw-Eval, wykonał 59,6% zadań podanych do trzech prób, wzrastając do 73,9% w połączeniu z silniejszym systemem agentów ZeroClaw.
Dlaczego wyniki małego modelu mają znaczenie
Dane porównawcze są godne uwagi, ponieważ pochodzą z modeli z około 3 do 4 miliardami aktywnych parametrów — znacznie mniejszych niż czołowe systemy OpenAI, Anthropic i Google, które dominują w rankingach. Microsoft argumentuje, że odpowiednia infrastruktura i środowisko szkoleniowe mogą wypełnić znaczną część luki, udostępniając wydajne systemy agentowe badaczom i organizacjom, których nie stać na szkolenie lub uruchamianie największych, zastrzeżonych modeli.
Oprócz modeli i przepływów pracy firma Microsoft udostępniła dane szkoleniowe i metody oceny użyte do ich zbudowania, mając za cel pomoc szerszej społeczności badawczej w budowaniu i badaniu otwartych systemów agentowych. Pracami kierowali Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng i Jianfeng Gao z Microsoft Research.
Wyprzedź sztuczną inteligencję
Wydanie Microsoftu Orchard sygnalizuje, że infrastruktura stojąca za pionierską sztuczną inteligencją zaczyna się demokratyzować. Przeczytaj więcej najświeższe wiadomości o AI i Przeczytaj więcej aktualności o AI →
