AjanlarAraştırma 🇺🇸 27.07.2026 05:04

SkillOpt: AI Ajan Becerilerini Eğitilebilir Parametrelere Dönüştürmek

MicrosoftMicrosoft OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Microsoft Research, SkillOpt adında bir yöntem sunuyor. Bu yöntem, ajan beceri dosyalarını dondurulmuş bir modelin dışında eğitilebilir parametreler olarak ele alıyor ve bunları kontrollü metin düzenlemeleri yoluyla optimize ediyor. 6 kıyaslama, 7 model ve 3 yürütme modu ile 52 değerlendirme hücresinde SkillOpt, temel yöntemleri sürekli olarak geride bırakıyor ve model ağırlıklarını değiştirmeden +23,5 puana kadar iyileştirme sağlıyor. Optimize edilmiş beceriler, model ölçekleri ve ajan koşumları arasında aktarılabiliyor ve kompakt ve denetlenebilir kalıyor.
Microsoft Research'in 'SkillOpt: Self-Evolving Agent Skills için Yönetici Stratejisi' başlıklı makalesi, ajan beceri düzenlemesini bir eğitim süreci olarak yeniden çerçeveliyor. SkillOpt, beceri dosyasını donmuş bir hedef modelin dışında eğitilebilir bir parametre olarak ele alıyor ve metin alanında ileri-geri-güncelleme döngüsü kullanıyor. İleri geçişte donmuş model eğitim görevlerini yürütüyor; geri geçişte bir optimize edici model yörüngeleri analiz ediyor; güncelleme adımı ise bir doğrulama kontrolüyle sınırlandırılmış düzenlemeler öneriyor. Reddedilen düzenlemeler negatif geri bildirim için saklanıyor ve yavaş/meta güncelleme daha uzun vadeli dersleri birleştiriyor. Altı kıyaslama (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld), yedi hedef model (GPT-5.5'ten Qwen3.5-4B'ye) ve üç yürütme modu (doğrudan sohbet, Codex, Claude Code) ile yapılan değerlendirmede SkillOpt, 52 hücrenin tamamında en iyi veya en iyiyle eşdeğer sonuçlara ulaştı. Doğrudan sohbette GPT-5.5 için altı kıyaslama ortalaması 58,8'den 82,3'e yükseldi (+23,5 puan). Kazançlar en çok prosedürel kıyaslamalarda görüldü: SpreadsheetBench 41,8'den 80,7'ye, OfficeQA 33,1'den 72,1'e ve LiveMathematicianBench 37,6'dan 66,9'a. Optimize edilmiş beceriler model ölçekleri, kızaklar ve ilgili görevler arasında transfer edildi; örneğin, Codex'te eğitilen bir elektronik tablo becerisi Claude Code'a aktarıldığında becerisiz taban çizgisini 22,1'den 81,8'e çıkardı (+59,7). Nihai beceri dosyaları kompakt kaldı (medyan ~920 token) ve yalnızca 1-4 kabul edilmiş düzenleme içerdi. SkillOpt, eğitimin model ağırlıklarının dışındaki prosedürel bilgiye uygulanabileceğini ve ajan iş akışları için kontrol edilebilir, denetlenebilir bir uyarlama katmanı sunduğunu öne sürüyor.
Kaynak: Microsoft Research — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler