Microsoft Research випустила Orchard, фреймворк з відкритим вихідним кодом для створення, навчання та оцінки автономних агентів штучного інтелекту, який, за словами компанії, дозволяє відносно невеликим відкритим моделям наблизитися до продуктивності передових систем більш ніж у десять разів. Проект, детально описаний у дописі в блозі 3 серпня 2026 року, є найамбітнішою спробою компанії надати ширшому дослідницькому співтовариству таку інфраструктуру, яка до цього часу здебільшого залишалася замкненою у власних лабораторіях.
Випуск з’являється в той момент, коли галузь штучного інтелекту переходить від статичних відповідей на запитання до агентів, які можуть планувати, міркувати та діяти в багатоетапних середовищах. Щоб дізнатися більше про те, як галузь рухається до автономних систем, перегляньте [останнє висвітлення індустрії ШІ] (https://aibuzzwire.news).
Що таке Orchard насправді
У центрі проекту знаходиться Orchard Env, легка служба середовища на основі Kubernetes, яка надає багаторазові ізольовані компоненти для запуску агентів у масштабі. За словами Microsoft, той самий сервіс може підтримувати агенти розробки програмного забезпечення, агенти веб-перегляду та агенти персональних помічників без змін. Він обробляє все: від збору навчальних даних до розгортання підкріпленого навчання й оцінювання.
Ключове архітектурне рішення полягає в тому, що середовище виконання розглядається як окрема служба, яку можна багаторазово використовувати, а не інфраструктура, вбудована в спеціальну навчальну структуру. Оскільки Orchard Env працює на Kubernetes, він може створювати, керувати та видаляти тисячі ізольованих контейнерів паралельно. Команди можуть запроваджувати нові тести, системи агентів або навчальні алгоритми, не перебудовуючи базову інфраструктуру з нуля.
Тренування в справжніх упряжках
Однією з відмінних особливостей Orchard є його здатність навчати агентів безпосередньо в джгутах розгортання, які вони фактично використовуватимуть у виробництві. Сучасні найздібніші агенти рідко виступають як гола модель. Вони працюють за допомогою складних джгутів, таких як Codex, OpenClaw і ZeroClaw, які керують багатоповоротним мисленням, використанням інструментів і підключенням до зовнішніх систем.
Відкриті навчальні інструменти зазвичай не можуть працювати з цими багатопроцесорними системами з підтримкою стану, що змушує дослідників тренуватися на спрощеному резерві, а потім розгортати в реальних умовах, що створює невідповідність між навчанням і розгортанням. Orchard усуває цю прогалину: легкий проксі-сервер записує виклики власної моделі джгута як навчальні дані, тоді як кожне розгортання виконується у власному контейнері, що дозволяє агенту наскрізно навчатися безпосередньо в джгуті, який він використовуватиме у виробництві.
Три доменно-спеціальні рецепти
Щоб продемонструвати цей підхід, Microsoft випустила три навчальні робочі процеси.
Orchard-SWE: розробка програмного забезпечення
Orchard-SWE націлений на одне з найвимогливіших налаштувань для автономних агентів: багатоетапне обґрунтування реальних кодових баз. Його створено за допомогою фреймворку Mini-SWE-Agent і оцінено на SWE-bench Verified, тесті, який перевіряє здатність моделі навігації, діагностики та ремонту реальних кодових баз.
Щоб навчити систему, Microsoft відібрала 107 000 взаємодій агентів із двох просунутих відкритих моделей MiniMax-M2.5 і Qwen3.5-397B, що охоплюють широкий спектр проблем GitHub. Використовуючи техніку, що називається точною настройкою з контролем розподілу кредитів, система вчиться на продуктивних частинах часткових спроб, а не відкидає їх повністю.
Результати переміщують модель з 61,4% базового рівня на SWE-bench Verified до 69,1% з навчанням з підкріпленням і 69,7% з методами щільної винагороди. З реранжуванням моделі цінностей показник сягає 73,0% — це новий рівень техніки серед моделей із відкритим кодом порівнянного розміру, які використовують лише близько 3 мільярдів активних параметрів.
Orchard-GUI: веб-навігація
Orchard-GUI навчає мовну модель з 4 мільярдами параметрів як агент браузера. Незважаючи на використання відносно невеликої кількості нагляду — 400 дистильованих демонстрацій у поєднанні з 2200 відкритими навчальними завданнями — модель досягла 74,1% на WebVoyager, 67,0% на Online-Mind2Web і 64,0% на DeepShop, у середньому 68,4%. Корпорація Майкрософт стверджує, що ці результати відносять її до найпотужніших веб-агентів із відкритим кодом на сьогодні.
Orchard-Claw: завдання особистого помічника
Orchard-Claw зосереджується на щоденних продуктивних завданнях, таких як читання та написання електронних листів, керування календарями та пошук інформації. Натренований лише на 200 синтетичних завданнях і оцінений за еталонним тестом Claw-Eval, він виконав 59,6% завдань за три спроби, збільшуючись до 73,9% у поєднанні з потужнішою системою агентів ZeroClaw.
Чому результати малої моделі важливі
Порівняльні показники примітні, оскільки вони отримані від моделей із приблизно 3-4 мільярдами активних параметрів — набагато менше, ніж передові системи OpenAI, Anthropic і Google, які домінують у таблицях лідерів. Аргумент Microsoft полягає в тому, що правильна навчальна інфраструктура та середовище можуть усунути значну частину прогалин, зробивши потужні агентські системи доступними для дослідників та організацій, які не можуть дозволити собі навчати чи запускати найбільші власні моделі.
Окрім моделей і робочих процесів, Microsoft опублікувала навчальні дані та методи оцінки, які використовувалися для їх створення, із заявленою метою допомогти більш широкому дослідницькому співтовариству створювати та вивчати відкриті агентні системи. Роботою керували Баолінь Пен, Веньлінь Яо, Цяньхуей Ву, Хао Чен і Цзяньфен Гао з Microsoft Research.
Будьте попереду ШІ
Випуск Microsoft Orchard сигналізує про те, що інфраструктура, що стоїть за передовим агентським ШІ, починає демократизуватися. Читайте більше найновіші новини AI і Читайте більше новин AI →
