Orchard : un cadre ouvert pour une IA agentique évolutive
Microsoft
MiniMax
Alibaba/Qwen
Microsoft Research présente Orchard, un cadre open source conçu pour faire évoluer la recherche en IA agentique. Il comprend Orchard Env, un service d'environnement basé sur Kubernetes, ainsi que trois recettes d'entraînement (SWE, GUI, Claw) qui démontrent de bonnes performances avec des modèles relativement petits. Le projet met à disposition de la communauté les données d'entraînement et les méthodes d'évaluation.
Microsoft Research a publié Orchard, un framework open-source pour la recherche agentique IA évolutive et rentable. Au cœur de celui-ci se trouve Orchard Env, un service d'environnement basé sur Kubernetes fournissant des composants isolés réutilisables pour l'entraînement et l'évaluation d'agents dans divers domaines de tâches. Le framework prend en charge les agents d'ingénierie logicielle, de navigation web et d'assistant personnel, et peut les entraîner directement dans des environnements de déploiement réels tels que Codex, OpenClaw et ZeroClaw. Le projet introduit trois recettes d'entraînement : Orchard-SWE, Orchard-GUI et Orchard-Claw. Pour l'ingénierie logicielle, Orchard-SWE utilise 107 000 interactions d'agents distillées à partir de MiniMax-M2.5 et Qwen3.5-397B, avec un apprentissage supervisé par attribution de crédit et un apprentissage par renforcement, atteignant 69,7 % sur SWE-bench Verified (73,0 % avec reclassement par modèle de valeur) en utilisant seulement environ 3 milliards de paramètres actifs. Pour la navigation web, Orchard-GUI entraîne un modèle de langage visuel de 4 milliards de paramètres avec une supervision limitée (400 démonstrations et 2 200 tâches), atteignant une moyenne de 68,4 % sur WebVoyager, Online-Mind2Web et DeepShop. Pour l'assistance personnelle, Orchard-Claw, entraîné sur 200 tâches synthétiques à travers plusieurs environnements, atteint 59,6 % sur Claw-Eval (73,9 % avec ZeroClaw). Le framework vise à réduire les coûts de recherche en fournissant une infrastructure ouverte, et les auteurs soulignent l'efficacité des données et l'apprentissage cumulatif des agents comme directions futures. Toutes les données d'entraînement et les méthodes d'évaluation sont publiées à la communauté.
Source: Microsoft Research —
original
