Microsoft Research ha lanzado Orchard, un marco de código abierto para construir, entrenar y evaluar agentes autónomos de IA que, según la compañía, permite que modelos abiertos relativamente pequeños se acerquen al rendimiento de sistemas fronterizos más de diez veces su tamaño. El proyecto, detallado en una publicación de blog del 3 de agosto de 2026, es la apuesta más ambiciosa de la compañía hasta el momento para brindar a la comunidad de investigación en general el tipo de infraestructura que, hasta ahora, ha permanecido en gran medida encerrada dentro de laboratorios propietarios.
El lanzamiento llega cuando la industria de la IA pasa de la respuesta estática a preguntas a agentes que pueden planificar, razonar y actuar en entornos de varios pasos. Para obtener más información sobre cómo el campo avanza hacia los sistemas autónomos, consulte nuestra [última cobertura de la industria de la IA] (https://aibuzzwire.news).
¿Qué es realmente Orchard?
En el centro del proyecto se encuentra Orchard Env, un servicio de entorno liviano basado en Kubernetes que proporciona componentes aislados y reutilizables para ejecutar agentes a escala. Según Microsoft, el mismo servicio puede admitir agentes de ingeniería de software, agentes de navegación web y agentes de asistente personal sin modificaciones. Se encarga de todo, desde la recopilación de datos de entrenamiento hasta la implementación y evaluación del aprendizaje por refuerzo.
La decisión arquitectónica clave es que el entorno de ejecución se trate como un servicio independiente y reutilizable en lugar de una infraestructura integrada dentro de un marco de capacitación específico. Debido a que Orchard Env se basa en Kubernetes, puede crear, administrar y eliminar miles de contenedores aislados en paralelo. Los equipos pueden introducir nuevos puntos de referencia, sistemas de agentes o algoritmos de capacitación sin reconstruir la infraestructura subyacente desde cero.
Entrenamiento dentro de arneses reales
Una de las características distintivas de Orchard es su capacidad para capacitar a los agentes directamente dentro de los arneses de implementación que realmente utilizarán en producción. Los agentes más capaces de hoy rara vez funcionan como un modelo simple. Operan a través de arneses sofisticados como Codex, OpenClaw y ZeroClaw que gestionan el razonamiento de múltiples turnos, el uso de herramientas y las conexiones a sistemas externos.
Las herramientas de capacitación abiertas generalmente no pueden manejar estos arneses multiproceso con estado, lo que obliga a los investigadores a capacitarse en un sustituto simplificado y luego implementar en el entorno real, lo que crea un desajuste entre la capacitación y la implementación. Orchard cierra esta brecha: un proxy liviano registra las llamadas al modelo propio del arnés como datos de entrenamiento mientras cada implementación se ejecuta en su propio contenedor, lo que permite capacitar a un agente de extremo a extremo directamente en el arnés que usará en producción.
Tres recetas específicas de dominio
Para demostrar el enfoque, Microsoft lanzó tres flujos de trabajo de capacitación.
Orchard-SWE: ingeniería de software
Orchard-SWE apunta a uno de los entornos más exigentes para los agentes autónomos: el razonamiento de varios pasos sobre bases de código reales. Fue creado utilizando el marco Mini-SWE-Agent y evaluado en SWE-bench Verified, un punto de referencia que prueba la capacidad de un modelo para navegar, diagnosticar y reparar bases de código del mundo real.
Para entrenar el sistema, Microsoft destiló 107.000 interacciones de agentes de dos modelos avanzados de peso abierto, MiniMax-M2.5 y Qwen3.5-397B, que cubren una amplia gama de problemas de GitHub. Utilizando una técnica llamada ajuste fino supervisado de asignación de crédito, el sistema aprende de las partes productivas de intentos parciales en lugar de descartarlas por completo.
Los resultados mueven el modelo de una base de referencia del 61,4 % en SWE-bench Verified a un 69,1 % con aprendizaje por refuerzo y a un 69,7 % con técnicas de recompensa densa. Con la reclasificación del modelo de valor, la cifra alcanza el 73,0%, un nuevo estado del arte entre los modelos de código abierto de tamaño comparable, que utiliza sólo alrededor de 3 mil millones de parámetros activos.
Orchard-GUI: navegación web
Orchard-GUI entrena un modelo de lenguaje de visión de 4 mil millones de parámetros como agente de navegador. A pesar de utilizar una cantidad relativamente pequeña de supervisión (400 demostraciones combinadas con 2200 tareas de capacitación abiertas), el modelo logró un 74,1% en WebVoyager, un 67,0% en Online-Mind2Web y un 64,0% en DeepShop, para un promedio de 68,4%. Microsoft dice que estos resultados lo colocan entre los agentes web de código abierto más sólidos hasta la fecha.
Orchard-Claw: tareas de asistente personal
Orchard-Claw se centra en tareas de productividad cotidianas, como leer y redactar correos electrónicos, gestionar calendarios y buscar información. Entrenado en solo 200 tareas sintéticas y evaluado en el punto de referencia Claw-Eval, completó el 59,6% de las tareas en hasta tres intentos, aumentando al 73,9% cuando se combina con el sistema de agente ZeroClaw más potente.
Por qué son importantes los resultados del modelo pequeño
Las cifras de referencia son notables porque provienen de modelos con aproximadamente entre 3 y 4 mil millones de parámetros activos, mucho más pequeños que los sistemas fronterizos de OpenAI, Anthropic y Google que dominan las tablas de clasificación. El argumento de Microsoft es que la infraestructura y el entorno de capacitación adecuados pueden cerrar gran parte de la brecha, haciendo que los sistemas agentes capaces sean accesibles para investigadores y organizaciones que no pueden darse el lujo de entrenar o ejecutar los modelos propietarios más grandes.
Además de los modelos y flujos de trabajo, Microsoft publicó los datos de capacitación y los métodos de evaluación utilizados para construirlos, con el objetivo declarado de ayudar a la comunidad de investigación en general a construir y estudiar sistemas agentes abiertos. El trabajo fue dirigido por Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng y Jianfeng Gao de Microsoft Research.
Manténgase por delante de la IA
El lanzamiento de Orchard de Microsoft indica que la infraestructura detrás de la IA agente de frontera está comenzando a democratizarse. Lea más últimas noticias sobre IA y Lea más noticias sobre IA →
