SkillOpt:将AI智能体技能转化为可训练参数
Microsoft
OpenAI
Alibaba/Qwen
微软研究院推出SkillOpt方法,将智能体技能文件视为冻结模型外的可训练参数,通过受控文本编辑进行优化。在涵盖6个基准、7种模型和3种执行模式的52个评估单元中,SkillOpt持续优于基线,无需修改模型权重即可实现高达+23.5分的提升。优化后的技能可跨模型规模和智能体框架迁移,且保持紧凑和可审计性。
微软研究院的论文《SkillOpt:面向自我进化智能体技能的优化策略》将智能体技能编辑重新定义为一种训练过程。SkillOpt 将技能文件视为冻结目标模型外部的可训练参数,在文本空间中采用正向-反向-更新循环。在前向传播中,冻结模型执行训练任务;反向传播使用优化器模型分析轨迹;更新步骤提出有限编辑,并通过验证检查进行门控。被拒绝的编辑将被存储以用于负反馈,而慢速/元更新则整合更长期的教训。在六个基准测试(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld)上,使用七个目标模型(从 GPT-5.5 到 Qwen3.5-4B)和三种执行模式(直接对话、Codex、Claude Code)进行评估,SkillOpt 在所有 52 个单元格中均取得最佳或并列最佳结果。对于 GPT-5.5 的直接对话模式,六个基准的平均分从 58.8 升至 82.3(提高 23.5 分)。在程序性基准上提升最大:SpreadsheetBench 从 41.8 升至 80.7,OfficeQA 从 33.1 升至 72.1,LiveMathematicianBench 从 37.6 升至 66.9。优化后的技能可跨模型规模、工具链及相关任务迁移;例如,在 Codex 中训练的电子表格技能迁移到 Claude Code 后,将无技能基线从 22.1 提升至 81.8(提高 59.7 分)。最终技能文件保持紧凑(中位数约 920 个标记),仅包含 1 到 4 次接受的编辑。SkillOpt 表明,训练可以应用于模型权重之外的程序性知识,为智能体工作流提供可控且可审计的适应层。
来源: Microsoft Research —
原文
