SkillOpt: Transformando Habilidades de Agentes de IA em Parâmetros Treináveis
Microsoft
OpenAI
Alibaba/Qwen
A Microsoft Research apresenta o SkillOpt, um método que trata arquivos de habilidades de agentes como parâmetros treináveis fora de um modelo congelado, otimizando-os por meio de edições controladas de texto. Em 52 células de avaliação com 6 benchmarks, 7 modelos e 3 modos de execução, o SkillOpt supera consistentemente as linhas de base, alcançando até +23,5 pontos de melhoria sem modificar os pesos do modelo. As habilidades otimizadas se transferem entre escalas de modelo e estruturas de agentes, permanecendo compactas e auditáveis.
O artigo 'SkillOpt: Estratégia Executiva para Habilidades de Agente Auto-Evolutivas' do Microsoft Research reformula a edição de habilidades de agentes como um processo de treinamento. O SkillOpt trata o arquivo de habilidade como um parâmetro treinável fora de um modelo alvo congelado, usando um ciclo forward-backward-update no espaço de texto. Na passagem forward, o modelo congelado executa tarefas de treinamento; a passagem backward usa um modelo otimizador para analisar trajetórias; o passo de atualização propõe edições limitadas, controladas por uma verificação de validação. Edições rejeitadas são armazenadas para feedback negativo, e uma atualização lenta/meta consolida lições de horizonte mais longo. Avaliado em seis benchmarks (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) com sete modelos alvo (do GPT-5.5 ao Qwen3.5-4B) e três modos de execução (chat direto, Codex, Claude Code), o SkillOpt alcançou os melhores resultados ou empatou nos melhores em todas as 52 células. Para o GPT-5.5 no chat direto, a média dos seis benchmarks subiu de 58,8 para 82,3 (+23,5 pontos). Os maiores ganhos ocorreram em benchmarks processuais: SpreadsheetBench de 41,8 para 80,7, OfficeQA de 33,1 para 72,1 e LiveMathematicianBench de 37,6 para 66,9. As habilidades otimizadas foram transferidas entre escalas de modelo, plataformas e tarefas relacionadas; por exemplo, uma habilidade de planilha treinada no Codex e transferida para o Claude Code melhorou o baseline sem habilidade de 22,1 para 81,8 (+59,7). Os arquivos de habilidade finais permaneceram compactos (mediana de ~920 tokens) com apenas 1-4 edições aceitas. O SkillOpt sugere que o treinamento pode ser aplicado a conhecimento processual fora dos pesos do modelo, oferecendo uma camada de adaptação controlável e auditável para fluxos de trabalho agentivos.
Fonte: Microsoft Research —
original
