SkillOpt de Microsoft demuestra que los artefactos de habilidades optimizadas se transfieren entre escalas de modelos y entre entornos Codex y Claude Code
Microsoft
OpenAI
Investigadores de Microsoft y varias universidades desarrollaron SkillOpt, un optimizador de espacio de texto que entrena un único documento de habilidades en lenguaje natural mientras mantiene congelado el modelo objetivo. Las pruebas muestran que las habilidades entrenadas en un entorno (Codex) pueden transferirse a otro (Claude Code), a veces superando el entrenamiento dentro del mismo dominio. El artefacto, best_skill.md, es un archivo de texto portátil de 379 a 1995 tokens.
SkillOpt es un optimizador de espacio de texto que entrena un único documento de habilidad en lenguaje natural mientras que el modelo objetivo permanece congelado. Un modelo optimizador propone ediciones acotadas a la habilidad basándose en evaluaciones puntuadas, y una división de validación acepta ediciones solo si la puntuación mejora estrictamente. El artefacto exportado es un único archivo, best_skill.md. La transferencia entre modelos dentro de la familia GPT-5.4 muestra una retención mixta: SpreadsheetBench en GPT-5.4-mini retiene el 82% de la ganancia en el dominio, mientras que GPT-5.4-nano retiene solo el 16% en SpreadsheetBench; LiveMath en nano muestra una retención del 140%, lo que sugiere que algunos procedimientos son independientes del modelo. La transferencia entre sistemas usando GPT-5.5 produce el resultado más fuerte: una habilidad optimizada en Codex eleva a Claude Code en SpreadsheetBench de 22,1 a 81,8, superando la puntuación propia de Claude Code en el dominio de 80,4. Sin embargo, la transferencia de LiveMath de Codex a Claude Code retiene solo el 10% de la ganancia, lo que indica que las habilidades que requieren mucho razonamiento son menos portables. La transferencia entre benchmarks de OlympiadBench a Omni-MATH muestra ganancias pequeñas pero positivas en tres escalas de modelo. El mecanismo que permite la transferencia es que todos los modos de ejecución consumen el mismo formato best_skill.md, y la naturaleza procedimental de la habilidad (por ejemplo, la inspección de la estructura del libro de trabajo) la hace portable. El costo de entrenamiento se paga una sola vez fuera de línea, sin sobrecarga en el tiempo de inferencia. El artefacto es auditable como un archivo de texto con registros de cada edición.
Fuente: MarkTechPost —
original
