SkillOpt: Turning AI Agent Skills into Trainable Parameters
Microsoft
OpenAI
Alibaba/Qwen
Microsoft researchers introduced SkillOpt, a method that treats an agent's skill file as a trainable parameter outside the frozen model. The approach achieved best or comparable results in all 52 evaluation cells across six benchmarks with seven models, including GPT-5.5. Optimized skills are compact, readable, and transferable across models and runtime environments.
Microsoft Researchは、エージェントAIのスキル編集を制御可能な学習プロセスに変換する手法「SkillOpt(Skill Optimization)」を発表しました。手動での記述や単一パスでのスキル生成とは異なり、SkillOptはスキルファイルを、凍結されたターゲットモデルの外部にある学習可能なパラメータとして扱います。プロセスは、順伝搬(現在のスキルによるタスク実行)、逆伝搬(個別の最適化モデルによる軌跡の分析)、およびテキスト学習率で制限された小さな編集(追加、削除、置換)による更新ステップで構成されます。提案された各変更は、ホールドアウトサンプルで厳格に検証され、結果が厳密に改善された場合にのみ受け入れられます。拒否された編集は負のフィードバックバッファに格納されます。また、長期的な教訓を抽出するためのスロー/メタ更新も使用されます。SkillOptは、GPT-5.5からQwen3.5-4Bまでの7つのモデルと3つの実行モード(対話、Codex、Claude Code)を用いて、6つのベンチマーク(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld)でテストされました。この手法は、全52の評価セルで最良または同等の結果を示しました。対話モードのGPT-5.5では、6つのベンチマークの平均結果が58.8から82.3へと23.5ポイント向上しました。最大の改善は手続き型ベンチマークで見られ、SpreadsheetBenchは41.8から80.7、OfficeQAは33.1から72.1、LiveMathematicianBenchは37.6から66.9に向上しました。最適化されたスキルは、異なるサイズのモデル、実行環境、関連タスク間で転送可能であり、汎化された手続き的知識の捕捉を示しています。例えば、Codexで学習されClaude Codeに転送されたスプレッドシートスキルは、ベースライン結果を22.1から81.8へと59.7ポイント向上させました。最終的なスキルファイルはコンパクトで(中央値約920トークン)、1~4個の受け入れられた編集を含みます。この手法はGitHubリポジトリとプロジェクトページで利用可能です。
出典: Microsoft Research —
原文
