HabilidadesAgentes 🇺🇸 27.07.2026 05:04

SkillOpt: convirtiendo las habilidades de los agentes de IA en parámetros entrenables

MicrosoftMicrosoft OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Investigadores de Microsoft presentaron SkillOpt, un método que trata el archivo de habilidades de un agente como un parámetro entrenable fuera del modelo congelado. El enfoque logró los mejores resultados o resultados comparables en las 52 celdas de evaluación en seis puntos de referencia con siete modelos, incluido GPT-5.5. Las habilidades optimizadas son compactas, legibles y transferibles entre modelos y entornos de ejecución.
Microsoft Research ha presentado SkillOpt (Skill Optimization), un método que convierte la edición de habilidades de agentes de IA en un proceso de aprendizaje controlado. A diferencia de la escritura manual o la generación de habilidades en una sola pasada, SkillOpt trata el archivo de habilidad como un parámetro entrenable ubicado fuera del modelo objetivo congelado. El proceso incluye una pasada hacia adelante (ejecución de tareas con la habilidad actual), una pasada hacia atrás (análisis de trayectorias por un modelo optimizador separado) y un paso de actualización con pequeñas ediciones (adición, eliminación, reemplazo), limitadas por una tasa de aprendizaje textual. Cada cambio propuesto pasa por una estricta validación en un conjunto de validación diferida: solo se acepta si mejora estrictamente el resultado. Las ediciones rechazadas se almacenan en un búfer de retroalimentación negativa. También se utiliza una actualización lenta o meta-actualización para extraer lecciones a largo plazo. SkillOpt se ha probado en seis puntos de referencia (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) con siete modelos, desde GPT-5.5 hasta Qwen3.5-4B, y en tres modos de ejecución (diálogo, Codex, Claude Code). El método obtuvo el mejor resultado o un resultado igual al mejor en las 52 celdas de evaluación. Para GPT-5.5 en modo diálogo, el resultado promedio en los seis puntos de referencia aumentó de 58.8 a 82.3 (+23.5 puntos). Las mayores mejoras se dieron en puntos de referencia procedimentales: SpreadsheetBench de 41.8 a 80.7, OfficeQA de 33.1 a 72.1, LiveMathematicianBench de 37.6 a 66.9. Las habilidades optimizadas se transfieren entre modelos de diferentes tamaños, entornos de ejecución y tareas afines, demostrando la captura de conocimiento procedimental generalizado. Por ejemplo, una habilidad para hojas de cálculo entrenada en Codex y transferida a Claude Code elevó el resultado base de 22.1 a 81.8 (+59.7). El archivo de habilidad final es compacto (longitud mediana de aproximadamente 920 tokens) y contiene de una a cuatro ediciones aceptadas. El método está disponible en el repositorio de GitHub y en la página del proyecto.
Fuente: Microsoft Research — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas