AgenRiset 🇺🇸 27.07.2026 05:04

SkillOpt: Mengubah Keahlian Agen AI menjadi Parameter yang Dapat Dilatih

MicrosoftMicrosoft OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Microsoft Research memperkenalkan SkillOpt, sebuah metode yang memperlakukan file keahlian agen sebagai parameter yang dapat dilatih di luar model yang dibekukan, mengoptimalkannya melalui suntingan teks yang terkontrol. Di 52 sel evaluasi dengan 6 tolok ukur, 7 model, dan 3 mode eksekusi, SkillOpt secara konsisten mengunggali dasar-dasar, mencapai peningkatan hingga +23,5 poin tanpa mengubah bobot model. Keahlian yang dioptimalkan dapat ditransfer antar skala model dan perangkat agen, tetap ringkas dan dapat diaudit.
Makalah Microsoft Research 'SkillOpt: Executive Strategy for Self-Evolving Agent Skills' membingkai ulang pengeditan keterampilan agen sebagai proses pelatihan. SkillOpt memperlakukan file keterampilan sebagai parameter yang dapat dilatih di luar model target yang dibekukan, menggunakan siklus maju-mundur-perbarui dalam ruang teks. Pada langkah maju, model yang dibekukan menjalankan tugas pelatihan; langkah mundur menggunakan model pengoptimal untuk menganalisis lintasan; langkah pembaruan mengusulkan pengeditan terbatas yang dikendalikan oleh pemeriksaan validasi. Pengeditan yang ditolak disimpan untuk umpan balik negatif, dan pembaruan lambat/meta mengonsolidasikan pelajaran jangka panjang. Dievaluasi pada enam tolok ukur (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) dengan tujuh model target (dari GPT-5.5 hingga Qwen3.5-4B) dan tiga mode eksekusi (obrolan langsung, Codex, Claude Code), SkillOpt mencapai hasil terbaik atau setara terbaik di semua 52 sel. Untuk GPT-5.5 dalam obrolan langsung, rata-rata enam tolok ukur naik dari 58,8 menjadi 82,3 (+23,5 poin). Peningkatan terbesar terjadi pada tolok ukur prosedural: SpreadsheetBench dari 41,8 menjadi 80,7, OfficeQA dari 33,1 menjadi 72,1, dan LiveMathematicianBench dari 37,6 menjadi 66,9. Keterampilan yang dioptimalkan dapat ditransfer antar skala model, kerangka kerja, dan tugas terkait; misalnya, keterampilan spreadsheet yang dilatih di Codex ditransfer ke Claude Code meningkatkan dasar tanpa keterampilan dari 22,1 menjadi 81,8 (+59,7). File keterampilan akhir tetap ringkas (median sekitar 920 token) dengan hanya 1-4 pengeditan yang diterima. SkillOpt menunjukkan bahwa pelatihan dapat diterapkan pada pengetahuan prosedural di luar bobot model, menawarkan lapisan adaptasi yang terkendali dan dapat diaudit untuk alur kerja agen.
Sumber: Microsoft Research — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru