BecerilerAjanlar 🇺🇸 27.07.2026 05:04

SkillOpt: Turning AI Agent Skills into Trainable Parameters

MicrosoftMicrosoft OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Microsoft researchers introduced SkillOpt, a method that treats an agent's skill file as a trainable parameter outside the frozen model. The approach achieved best or comparable results in all 52 evaluation cells across six benchmarks with seven models, including GPT-5.5. Optimized skills are compact, readable, and transferable across models and runtime environments.
Microsoft Research, SkillOpt (Skill Optimization) adını verdiği, yapay zeka ajanlarının beceri düzenlemesini kontrollü bir öğrenme sürecine dönüştüren bir yöntemi tanıttı. El ile yazma veya tek geçişli beceri üretiminin aksine SkillOpt, beceri dosyasını donmuş hedef modelin dışında bulunan öğrenilebilir bir parametre olarak ele alır. Süreç, ileri geçiş (mevcut beceriyle görevleri yürütme), geri geçiş (yörüngeleri ayrı bir optimize edici modelle analiz etme) ve metinsel öğrenme hızıyla sınırlı küçük düzenlemeler (ekleme, silme, değiştirme) içeren bir güncelleme adımını kapsar. Önerilen her değişiklik, ayrılmış bir örneklem üzerinde sıkı bir doğrulamadan geçer: yalnızca sonuçta kesin bir iyileşme sağlarsa kabul edilir. Reddedilen düzenlemeler, negatif geri bildirim tamponuna gider. Uzun vadeli dersler çıkarmak için yavaş/meta-güncelleme de kullanılır. SkillOpt, GPT-5.5'ten Qwen3.5-4B'ye kadar yedi model ve üç yürütme moduyla (diyalog, Codex, Claude Code) altı kıyaslamada (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) test edildi. Yöntem, 52 değerlendirme hücresinin tümünde en iyi veya en iyiye bağlı sonucu gösterdi. GPT-5.5 için diyalog modunda altı kıyaslamada ortalama sonuç %58,8'den %82,3'e yükseldi (+23,5 puan). En büyük iyileştirmeler prosedürel kıyaslamalarda görüldü: SpreadsheetBench %41,8'den %80,7'ye, OfficeQA %33,1'den %72,1'e, LiveMathematicianBench %37,6'dan %66,9'a. Optimize edilmiş beceriler, farklı boyutlardaki modeller, yürütme ortamları ve ilgili görevler arasında taşınarak genelleştirilmiş prosedürel bilginin yakalanmasını sergiler. Örneğin, Codex'te öğrenilip Claude Code'a taşınan bir elektronik tablo becerisi, temel sonucu %22,1'den %81,8'e yükseltti (+59,7). Nihai beceri dosyası kompakttır (medyan uzunluk yaklaşık 920 token) ve bir ile dört arasında kabul edilmiş değişiklik içerir. Yöntem, GitHub deposunda ve proje sayfasında mevcuttur.
Kaynak: Microsoft Research — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler