RechercheAgents 🇺🇸 06.08.2026 04:01

SkillOpt de Microsoft : des artefacts de compétences optimisés transférables entre échelles de modèles et entre Codex et Claude Code

MicrosoftMicrosoft OpenAIOpenAI
Des chercheurs de Microsoft et de plusieurs universités ont développé SkillOpt, un optimiseur d'espace textuel qui entraîne un document de compétence unique en langage naturel tout en gardant le modèle cible figé. Les tests montrent que les compétences entraînées dans un environnement (Codex) peuvent être transférées dans un autre (Claude Code), surpassant parfois l'entraînement en domaine. L'artefact, best_skill.md, est un fichier texte portable de 379 à 1 995 jetons.
SkillOpt est un optimiseur d'espace textuel qui entraîne un document de compétence unique en langage naturel pendant que le modèle cible reste figé. Un modèle optimiseur propose des modifications bornées à la compétence en se basant sur des déploiements notés, et une répartition mise de côté n'accepte les modifications que si le score s'améliore strictement. L'artefact exporté est un fichier unique, best_skill.md. Le transfert entre modèles au sein de la famille GPT-5.4 montre une rétention mitigée : SpreadsheetBench sur GPT-5.4-mini conserve 82% du gain intra-domaine, tandis que GPT-5.4-nano ne conserve que 16% sur SpreadsheetBench ; LiveMath sur nano montre une rétention de 140%, ce qui suggère que certaines procédures sont indépendantes du modèle. Le transfert entre environnements d'exécution utilisant GPT-5.5 donne le résultat le plus fort : une compétence optimisée dans Codex améliore Claude Code sur SpreadsheetBench de 22,1 à 81,8, dépassant le score intra-domaine de Claude Code lui-même, qui est de 80,4. Cependant, le transfert de LiveMath de Codex à Claude Code ne conserve que 10% du gain, ce qui indique que les compétences fortement basées sur le raisonnement sont moins portables. Le transfert entre références d'OlympiadBench à Omni-MATH montre des gains petits mais positifs à trois échelles de modèles. Le mécanisme qui permet le transfert est que tous les modes d'exécution consomment le même format best_skill.md, et la nature procédurale de la compétence (par exemple, l'inspection de la structure du classeur) la rend portable. Le coût d'entraînement est payé une fois hors ligne, sans frais supplémentaires au moment de l'inférence. L'artefact est auditable en tant que fichier texte avec des journaux de chaque modification.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches