Microsoft Research는 상대적으로 작은 개방형 모델이 크기의 10배 이상인 프론티어 시스템의 성능에 접근할 수 있도록 하는 자율 AI 에이전트를 구축, 교육 및 평가하기 위한 오픈 소스 프레임워크인 Orchard를 출시했습니다. 2026년 8월 3일 블로그 게시물에 자세히 설명된 이 프로젝트는 지금까지 주로 독점 연구실에 갇혀 있던 종류의 인프라를 더 광범위한 연구 커뮤니티에 제공하려는 회사의 가장 야심찬 입찰입니다.
이번 릴리스는 AI 산업이 정적인 질문 답변에서 다단계 환경 전반에 걸쳐 계획하고 추론하고 행동할 수 있는 에이전트로 전환함에 따라 출시되었습니다. 해당 분야가 어떻게 자율 시스템으로 나아가고 있는지 자세히 알아보려면 최신 AI 산업 보도를 참조하세요.
과수원은 실제로 무엇입니까
프로젝트의 중심에는 대규모 에이전트 실행을 위해 재사용 가능하고 격리된 구성 요소를 제공하는 경량 Kubernetes 기반 환경 서비스인 Orchard Env가 있습니다. Microsoft에 따르면 동일한 서비스가 소프트웨어 엔지니어링 에이전트, 웹 브라우징 에이전트 및 개인 보조 에이전트를 수정 없이 지원할 수 있습니다. 훈련 데이터 수집부터 강화 학습 출시 및 평가까지 모든 것을 처리합니다.
주요 아키텍처 결정은 런타임 환경을 특정 훈련 프레임워크 내에 내장된 인프라가 아닌 독립형, 재사용 가능한 서비스로 취급한다는 것입니다. Orchard Env는 Kubernetes에 위치하므로 수천 개의 격리된 컨테이너를 병렬로 생성, 관리 및 제거할 수 있습니다. 팀은 기본 인프라를 처음부터 다시 구축하지 않고도 새로운 벤치마크, 에이전트 시스템 또는 교육 알고리즘을 도입할 수 있습니다.
실제 하네스 내부 교육
Orchard의 차별화된 기능 중 하나는 프로덕션에서 실제로 사용할 배포 하네스 내에서 에이전트를 직접 교육할 수 있는 기능입니다. 오늘날 가장 유능한 에이전트가 순수 모델로 실행되는 경우는 거의 없습니다. 이는 다중 회전 추론, 도구 사용 및 외부 시스템 연결을 관리하는 Codex, OpenClaw 및 ZeroClaw와 같은 정교한 하네스를 통해 작동합니다.
개방형 교육 도구는 일반적으로 이러한 상태 저장 다중 프로세스 하네스를 처리할 수 없기 때문에 연구자가 단순화된 대기 상태에서 교육한 다음 실제 환경에 배포해야 하므로 교육과 배포 간에 불일치가 발생합니다. Orchard는 이러한 격차를 해소합니다. 경량 프록시는 하네스의 자체 모델 호출을 교육 데이터로 기록하고 각 롤아웃은 자체 컨테이너에서 실행되므로 에이전트가 프로덕션에서 사용할 하네스에서 직접 엔드투엔드 교육을 받을 수 있습니다.
세 가지 도메인별 레시피
이러한 접근 방식을 시연하기 위해 Microsoft는 세 가지 교육 워크플로를 출시했습니다.
Orchard-SWE: 소프트웨어 엔지니어링
Orchard-SWE는 자율 에이전트에 대한 가장 까다로운 설정 중 하나인 실제 코드베이스에 대한 다단계 추론을 목표로 합니다. Mini-SWE-Agent 프레임워크를 사용하여 구축되었으며 실제 코드베이스를 탐색, 진단 및 복구하는 모델의 능력을 테스트하는 벤치마크인 SWE-bench Verified에서 평가되었습니다.
시스템을 교육하기 위해 Microsoft는 광범위한 GitHub 문제를 다루는 두 가지 고급 개방형 모델인 MiniMax-M2.5 및 Qwen3.5-397B에서 107,000개의 에이전트 상호 작용을 추출했습니다. 학점 할당 감독 미세 조정이라는 기술을 사용하여 시스템은 부분 시도를 완전히 삭제하는 대신 생산적인 부분에서 학습합니다.
그 결과 모델은 SWE-bench Verified의 61.4% 기준에서 강화 학습의 경우 69.1%, 조밀한 보상 기술의 경우 69.7%로 이동합니다. 가치 모델 재순위를 적용하면 이 수치는 73.0%에 도달합니다. 이는 약 30억 개의 활성 매개변수만 사용하는 비슷한 규모의 오픈 소스 모델 중 새로운 수준입니다.
Orchard-GUI: 웹 탐색
Orchard-GUI는 40억 매개변수의 비전 언어 모델을 브라우저 에이전트로 훈련합니다. 상대적으로 적은 양의 감독(400개의 정제된 데모와 2,200개의 개방형 교육 작업을 결합)을 사용했음에도 불구하고 모델은 WebVoyager에서 74.1%, Online-Mind2Web에서 67.0%, DeepShop에서 64.0%를 달성하여 평균 68.4%를 달성했습니다. Microsoft는 이러한 결과가 현재까지 가장 강력한 오픈 소스 웹 에이전트 중 하나라고 밝혔습니다.
Orchard-Claw: 개인 비서 작업
Orchard-Claw는 이메일 읽기 및 초안 작성, 달력 관리, 정보 검색과 같은 일상적인 생산성 작업에 중점을 둡니다. 단 200개의 합성 작업에 대해 교육을 받고 Claw-Eval 벤치마크에서 평가한 결과, 최대 3번의 시도에 대해 59.6%의 작업을 완료했으며, 더 강력한 ZeroClaw 에이전트 시스템과 결합하면 73.9%까지 증가했습니다.
소규모 모델 결과가 중요한 이유
벤치마크 수치는 약 30억~40억 개의 활성 매개변수를 가진 모델에서 나온 것이기 때문에 주목할 만합니다. 이는 리더보드를 장악하고 있는 OpenAI, Anthropic 및 Google의 프론티어 시스템보다 훨씬 작습니다. Microsoft의 주장은 올바른 교육 인프라와 환경이 격차를 상당 부분 줄여 최대 규모의 독점 모델을 교육하거나 실행할 여유가 없는 연구원과 조직이 유능한 에이전트 시스템에 액세스할 수 있도록 한다는 것입니다.
모델 및 워크플로와 함께 Microsoft는 광범위한 연구 커뮤니티가 개방형 에이전트 시스템을 구축하고 연구할 수 있도록 지원한다는 목표를 가지고 이를 구축하는 데 사용된 교육 데이터 및 평가 방법을 공개했습니다. 이 작업은 Microsoft Research의 Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng 및 Jianfeng Gao가 주도했습니다.
AI보다 앞서 나가세요
Microsoft의 Orchard 릴리스는 개척자 AI 기반 인프라가 민주화되기 시작했음을 나타냅니다. AI 속보 및 AI 뉴스 더 읽기 → 자세히 알아보기
