SkillOpt: AI-agentvaardigheden omzetten in trainbare parameters
Microsoft
OpenAI
Alibaba/Qwen
Microsoft Research introduceert SkillOpt, een methode die vaardigheidsbestanden van agenten behandelt als trainbare parameters buiten een bevroren model en deze optimaliseert via gecontroleerde tekstbewerkingen. In 52 evaluatiecellen met 6 benchmarks, 7 modellen en 3 uitvoeringsmodi presteert SkillOpt consistent beter dan de baselines, met een verbetering tot +23,5 punten zonder modelgewichten aan te passen. Geoptimaliseerde vaardigheden zijn overdraagbaar tussen modelschalen en agent-harnassen, blijven compact en controleerbaar.
Het onderzoekspaper van Microsoft Research 'SkillOpt: Executive Strategy for Self-Evolving Agent Skills' herdefinieert het bewerken van agentvaardigheden als een trainingsproces. SkillOpt behandelt het vaardigheidsbestand als een trainbare parameter buiten een bevroren doelmodel, met behulp van een forward-backward-update cyclus in tekstuele ruimte. In de forward-pass voert het bevroren model trainingstaken uit; de backward-pass gebruikt een optimalisatiemodel om trajecten te analyseren; de updatestap stelt begrensde bewerkingen voor, die worden tegengehouden door een validatiecontrole. Afgewezen bewerkingen worden opgeslagen voor negatieve feedback en een langzame/meta-update consolideert lessen over een langere horizon. Geëvalueerd op zes benchmarks (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) met zeven doelmodellen (van GPT-5.5 tot Qwen3.5-4B) en drie uitvoeringsmodi (directe chat, Codex, Claude Code), behaalde SkillOpt in alle 52 cellen de beste of gedeeld beste resultaten. Voor GPT-5.5 in directe chat steeg het gemiddelde over zes benchmarks van 58,8 naar 82,3 (+23,5 punten). De grootste winsten werden geboekt op procedurele benchmarks: SpreadsheetBench van 41,8 naar 80,7, OfficeQA van 33,1 naar 72,1 en LiveMathematicianBench van 37,6 naar 66,9. Geoptimaliseerde vaardigheden werden overgedragen naar andere modelschalen, -harnassen en gerelateerde taken; zo verbeterde een spreadsheetvaardigheid getraind in Codex bij overdracht naar Claude Code de basislijn zonder vaardigheid van 22,1 naar 81,8 (+59,7). Definitieve vaardigheidsbestanden bleven compact (mediaan ~920 tokens) met slechts 1-4 geaccepteerde bewerkingen. SkillOpt suggereert dat training kan worden toegepast op procedurele kennis buiten modelgewichten, wat een controleerbare, auditbare aanpassingslaag biedt voor agentische workflows.
Bron: Microsoft Research —
origineel
