AgentsRecherche 🇺🇸 27.07.2026 05:04

SkillOpt : transformer les compétences des agents IA en paramètres entraînables

MicrosoftMicrosoft OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Microsoft Research présente SkillOpt, une méthode qui traite les fichiers de compétences des agents comme des paramètres entraînables en dehors d'un modèle figé, en les optimisant via des modifications textuelles contrôlées. Sur 52 cellules d'évaluation avec 6 benchmarks, 7 modèles et 3 modes d'exécution, SkillOpt surpasse systématiquement les lignes de base, atteignant jusqu'à +23,5 points d'amélioration sans modifier les poids du modèle. Les compétences optimisées se transfèrent entre les échelles de modèles et les infrastructures d'agents, tout en restant compactes et auditées.
L'article 'SkillOpt: Executive Strategy for Self-Evolving Agent Skills' de Microsoft Research redéfinit l'édition des compétences d'un agent comme un processus d'entraînement. SkillOpt traite le fichier de compétence comme un paramètre entraînable en dehors d'un modèle cible figé, en utilisant un cycle aller-retour-mise à jour dans l'espace textuel. Lors du passage aller, le modèle figé exécute des tâches d'entraînement ; le passage retour utilise un modèle optimiseur pour analyser les trajectoires ; l'étape de mise à jour propose des modifications limitées, contrôlées par une validation. Les modifications rejetées sont stockées pour un retour négatif, et une mise à jour lente/méta consolide les leçons à long terme. Évalué sur six benchmarks (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) avec sept modèles cibles (de GPT-5.5 à Qwen3.5-4B) et trois modes d'exécution (chat direct, Codex, Claude Code), SkillOpt a obtenu les meilleurs résultats ou des résultats ex æquo dans l'ensemble des 52 cellules. Pour GPT-5.5 en chat direct, la moyenne des six benchmarks est passée de 58,8 à 82,3 (+23,5 points). Les gains les plus importants ont été réalisés sur les benchmarks procéduraux : SpreadsheetBench de 41,8 à 80,7, OfficeQA de 33,1 à 72,1, et LiveMathematicianBench de 37,6 à 66,9. Les compétences optimisées se sont transférées à travers les échelles de modèles, les infrastructures et les tâches connexes ; par exemple, une compétence de tableur entraînée dans Codex et transférée à Claude Code a amélioré le niveau de base sans compétence de 22,1 à 81,8 (+59,7). Les fichiers de compétence finaux sont restés compacts (médiane d'environ 920 tokens) avec seulement 1 à 4 modifications acceptées. SkillOpt suggère que l'entraînement peut être appliqué aux connaissances procédurales en dehors des poids du modèle, offrant une couche d'adaptation contrôlable et vérifiable pour les workflows agentiques.
Source: Microsoft Research — original
Nos articles précédents sur ce sujet ↓
Infos fraîches