Orchard: un marco abierto para IA agéntica escalable
Microsoft
MiniMax
Alibaba/Qwen
Microsoft Research presenta Orchard, un marco de código abierto diseñado para escalar la investigación en IA agéntica. Incluye Orchard Env, un servicio de entorno basado en Kubernetes, y tres recetas de entrenamiento (SWE, GUI, Claw) que demuestran un rendimiento sólido con modelos relativamente pequeños. El proyecto libera datos de entrenamiento y métodos de evaluación a la comunidad.
Microsoft Research ha publicado Orchard, un framework de código abierto para la investigación de IA agéntica escalable y rentable. En su núcleo se encuentra Orchard Env, un servicio de entorno basado en Kubernetes que proporciona componentes aislados reutilizables para entrenar y evaluar agentes en diversos dominios de tareas. El framework admite agentes de ingeniería de software, navegación web y asistente personal, y puede entrenarlos directamente dentro de entornos de despliegue reales como Codex, OpenClaw y ZeroClaw. El proyecto introduce tres recetas de entrenamiento: Orchard-SWE, Orchard-GUI y Orchard-Claw. Para ingeniería de software, Orchard-SWE utiliza 107.000 interacciones destiladas de agentes de MiniMax-M2.5 y Qwen3.5-397B, con ajuste fino supervisado por asignación de crédito y aprendizaje por refuerzo, alcanzando el 69,7% en SWE-bench Verified (73,0% con reranking por modelo de valor) usando solo unos 3 mil millones de parámetros activos. Para navegación web, Orchard-GUI entrena un modelo de visión-lenguaje de 4 mil millones de parámetros con supervisión limitada (400 demostraciones y 2.200 tareas), logrando un promedio del 68,4% en WebVoyager, Online-Mind2Web y DeepShop. Para asistencia personal, Orchard-Claw, entrenado en 200 tareas sintéticas en múltiples entornos, alcanza el 59,6% en Claw-Eval (73,9% con ZeroClaw). El framework tiene como objetivo reducir los costos de investigación al proporcionar infraestructura abierta, y los autores destacan la eficiencia de datos y el aprendizaje acumulativo de agentes como direcciones futuras. Todos los datos de entrenamiento y métodos de evaluación se publican para la comunidad.
Fuente: Microsoft Research —
original
