스킬에이전트 🇺🇸 27.07.2026 05:04

SkillOpt: Turning AI Agent Skills into Trainable Parameters

MicrosoftMicrosoft OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
Microsoft researchers introduced SkillOpt, a method that treats an agent's skill file as a trainable parameter outside the frozen model. The approach achieved best or comparable results in all 52 evaluation cells across six benchmarks with seven models, including GPT-5.5. Optimized skills are compact, readable, and transferable across models and runtime environments.
Microsoft Research가 SkillOpt(Skill Optimization) 방법을 발표했습니다. 이는 AI 에이전트의 스킬 편집을 통제된 학습 프로세스로 전환합니다. 수동 작성이나 단일 패스 스킬 생성과 달리, SkillOpt는 스킬 파일을 동결된 대상 모델 외부에 위치한 학습 가능한 파라미터로 간주합니다. 프로세스는 순방향 패스(현재 스킬로 작업 수행), 역방향 패스(별도의 최적화 모델이 궤적 분석), 그리고 텍스트 학습률로 제한된 작은 편집(추가, 삭제, 교체)을 통한 업데이트 단계로 구성됩니다. 각 제안된 변경은 홀드아웃 세트에서 엄격한 검증을 거쳐 엄격한 성능 향상이 있을 때만 수락됩니다. 거부된 편집은 부정적 피드백 버퍼에 저장됩니다. 또한 장기적 교훈을 추출하기 위해 느린/메타 업데이트를 사용합니다. SkillOpt는 7가지 모델(GPT-5.5에서 Qwen3.5-4B까지)과 3가지 실행 모드(대화형, Codex, Claude Code)로 6가지 벤치마크(SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld)에서 테스트되었습니다. 이 방법은 52개 평가 셀 모두에서 최고 또는 동등한 최고 성과를 보였습니다. GPT-5.5의 대화형 모드에서 6가지 벤치마크 평균 점수는 58.8에서 82.3(+23.5점)으로 상승했습니다. 가장 큰 개선은 절차적 벤치마크에서 나타났습니다: SpreadsheetBench 41.8→80.7, OfficeQA 33.1→72.1, LiveMathematicianBench 37.6→66.9. 최적화된 스킬은 다른 크기의 모델, 실행 환경 및 유사한 작업 간에 전이 가능하며, 일반화된 절차적 지식의 포착을 보여줍니다. 예를 들어, Codex에서 학습되고 Claude Code로 전이된 스프레드시트 스킬은 기본 성능을 22.1에서 81.8(+59.7)로 향상시켰습니다. 최종 스킬 파일은 컴팩트하며(중앙값 길이 약 920 토큰), 1~4개의 수락된 변경을 포함합니다. 이 방법은 GitHub 저장소와 프로젝트 페이지에서 사용할 수 있습니다.
출처: Microsoft Research — 원문
관련 게시물 ↓
새로운 뉴스