Orchard: Ein offenes Framework für skalierbare agentische KI
Microsoft
MiniMax
Alibaba/Qwen
Microsoft Research stellt Orchard vor, ein Open-Source-Framework, das entwickelt wurde, um die Forschung an agentischer KI zu skalieren. Es umfasst Orchard Env, einen auf Kubernetes basierenden Umgebungsdienst, sowie drei Trainingsrezepte (SWE, GUI, Claw), die eine starke Leistung mit relativ kleinen Modellen demonstrieren. Das Projekt veröffentlicht Trainingsdaten und Evaluierungsmethoden für die Community.
Microsoft Research hat Orchard veröffentlicht, ein Open-Source-Framework für skalierbare und kosteneffiziente Forschung im Bereich agentischer künstlicher Intelligenz. Im Kern steht Orchard Env, ein auf Kubernetes basierender Umgebungsdienst, der wiederverwendbare isolierte Komponenten für das Training und die Evaluierung von Agenten über verschiedene Aufgabendomänen hinweg bereitstellt. Das Framework unterstützt Agenten für Softwareentwicklung, Webnavigation und persönliche Assistenten und kann diese direkt in realen Bereitstellungsumgebungen wie Codex, OpenClaw und ZeroClaw trainieren. Das Projekt führt drei Trainingsrezepte ein: Orchard-SWE, Orchard-GUI und Orchard-Claw. Für die Softwareentwicklung verwendet Orchard-SWE 107.000 destillierte Agenteninteraktionen von MiniMax-M2.5 und Qwen3.5-397B, mit Credit-Assignment-Supervised-Feintuning und bestärkendem Lernen, und erreicht 69,7 % bei SWE-bench Verified (73,0 % mit Value-Model-Reranking) unter Verwendung von nur etwa 3 Milliarden aktiven Parametern. Für die Webnavigation trainiert Orchard-GUI ein 4-Milliarden-Parameter-Vision-Language-Modell mit begrenzter Supervision (400 Demonstrationen und 2.200 Aufgaben) und erreicht durchschnittlich 68,4 % bei WebVoyager, Online-Mind2Web und DeepShop. Für die persönliche Assistenz erreicht Orchard-Claw, trainiert auf 200 synthetischen Aufgaben über mehrere Umgebungen hinweg, 59,6 % bei Claw-Eval (73,9 % mit ZeroClaw). Das Framework zielt darauf ab, Forschungskosten durch offene Infrastruktur zu senken, und die Autoren heben Dateneffizienz und kumulatives Agentenlernen als zukünftige Richtungen hervor. Alle Trainingsdaten und Evaluierungsmethoden werden der Gemeinschaft zur Verfügung gestellt.
Quelle: Microsoft Research —
Original
