SkillOpt:AIエージェントのスキルを訓練可能なパラメータに変換
Microsoft
OpenAI
Alibaba/Qwen
Microsoft Researchが、エージェントのスキルファイルを凍結モデル外の訓練可能なパラメータとして扱い、制御されたテキスト編集を通じて最適化する手法「SkillOpt」を発表。52の評価セル(6ベンチマーク、7モデル、3実行モード)で、ベースラインを一貫して上回り、最大+23.5ポイントの改善をモデル重みの変更なしに達成。最適化されたスキルはモデル規模やエージェントハーネス間で転送可能で、コンパクトかつ監査可能。
Microsoft Researchの論文『SkillOpt:自己進化型エージェントスキルのための実行戦略』は、エージェントスキルの編集をトレーニングプロセスとして再定義する。SkillOptは、スキルファイルを凍結されたターゲットモデルの外部にあるトレーニング可能なパラメータとして扱い、テキスト空間での順方向・逆方向・更新サイクルを用いる。順方向パスでは凍結モデルがトレーニングタスクを実行し、逆方向パスではオプティマイザモデルが軌跡を分析し、更新ステップでは検証チェックによってゲート制御された制限付き編集を提案する。拒否された編集はネガティブフィードバックとして保存され、スロー/メタ更新により長期的な教訓を統合する。6つのベンチマーク(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld)において、7つのターゲットモデル(GPT-5.5からQwen3.5-4Bまで)と3つの実行モード(ダイレクトチャット、Codex、Claude Code)で評価した結果、SkillOptは52セルすべてで最良または同点最良の結果を達成した。GPT-5.5のダイレクトチャットでは、6ベンチマークの平均が58.8から82.3(+23.5ポイント)に上昇した。最大の改善は手続き型ベンチマークで見られた:SpreadsheetBenchが41.8から80.7、OfficeQAが33.1から72.1、LiveMathematicianBenchが37.6から66.9となった。最適化されたスキルはモデル規模、ハーネス、関連タスク間で転移可能であり、例えば、CodexでトレーニングされたスプレッドシートスキルをClaude Codeに転送した場合、スキルなしのベースラインが22.1から81.8(+59.7)に改善した。最終的なスキルファイルはコンパクトで(中央値約920トークン)、受け入れられた編集は1~4件のみであった。SkillOptは、トレーニングがモデル重みの外部にある手続き的知識に適用できることを示唆しており、エージェントワークフローに制御可能で監査可能な適応レイヤーを提供する。
出典: Microsoft Research —
原文
