Orchard: Kerangka Terbuka untuk AI Agen yang Dapat Diskalakan
Microsoft
MiniMax
Alibaba/Qwen
Microsoft Research memperkenalkan Orchard, sebuah kerangka kerja sumber terbuka yang dirancang untuk menskalakan penelitian AI agen. Kerangka ini mencakup Orchard Env, layanan lingkungan berbasis Kubernetes, dan tiga resep pelatihan (SWE, GUI, Claw) yang menunjukkan performa kuat dengan model yang relatif kecil. Proyek ini merilis data pelatihan dan metode evaluasi kepada komunitas.
Microsoft Research telah merilis Orchard, sebuah kerangka kerja sumber terbuka untuk penelitian AI agen yang skalabel dan hemat biaya. Intinya adalah Orchard Env, layanan lingkungan berbasis Kubernetes yang menyediakan komponen terisolasi yang dapat digunakan kembali untuk melatih dan mengevaluasi agen di berbagai domain tugas. Kerangka kerja ini mendukung agen rekayasa perangkat lunak, navigasi web, dan asisten pribadi, serta dapat melatihnya langsung di dalam lingkungan penerapan nyata seperti Codex, OpenClaw, dan ZeroClaw. Proyek ini memperkenalkan tiga resep pelatihan: Orchard-SWE, Orchard-GUI, dan Orchard-Claw. Untuk rekayasa perangkat lunak, Orchard-SWE menggunakan 107.000 interaksi agen terdistilasi dari MiniMax-M2.5 dan Qwen3.5-397B, dengan penyetelan halus terawasi penugasan kredit dan pembelajaran penguatan, mencapai 69,7% pada SWE-bench Verified (73,0% dengan pemeringkatan ulang model nilai) hanya menggunakan sekitar 3 miliar parameter aktif. Untuk navigasi web, Orchard-GUI melatih model bahasa-visi 4 miliar parameter dengan pengawasan terbatas (400 demonstrasi dan 2.200 tugas), mencapai rata-rata 68,4% pada WebVoyager, Online-Mind2Web, dan DeepShop. Untuk asisten pribadi, Orchard-Claw, yang dilatih pada 200 tugas sintetis di berbagai lingkungan, mencapai 59,6% pada Claw-Eval (73,9% dengan ZeroClaw). Kerangka kerja ini bertujuan untuk menurunkan biaya penelitian dengan menyediakan infrastruktur terbuka, dan para penulis menyoroti efisiensi data dan pembelajaran agen kumulatif sebagai arah masa depan. Semua data pelatihan dan metode evaluasi dirilis untuk komunitas.
Sumber: Microsoft Research —
asli
