SkillOpt: Turning AI Agent Skills into Trainable Parameters
Microsoft
OpenAI
Alibaba/Qwen
Microsoft researchers introduced SkillOpt, a method that treats an agent's skill file as a trainable parameter outside the frozen model. The approach achieved best or comparable results in all 52 evaluation cells across six benchmarks with seven models, including GPT-5.5. Optimized skills are compact, readable, and transferable across models and runtime environments.
Microsoft Research đã giới thiệu phương pháp SkillOpt (Skill Optimization), biến việc chỉnh sửa kỹ năng của tác nhân AI thành một quy trình học tập có kiểm soát. Không giống như viết thủ công hoặc tạo kỹ năng một lần, SkillOpt coi tệp kỹ năng như một tham số có thể huấn luyện, nằm bên ngoài mô hình mục tiêu đã đóng băng. Quy trình bao gồm lượt xuôi (thực thi tác vụ với kỹ năng hiện tại), lượt ngược (một mô hình tối ưu hóa riêng phân tích quỹ đạo) và bước cập nhật với các chỉnh sửa nhỏ (thêm, xóa, thay thế) bị giới hạn bởi tốc độ học văn bản. Mỗi thay đổi đề xuất đều trải qua kiểm tra nghiêm ngặt trên tập dữ liệu kiểm tra độ trễ: chỉ được chấp nhận nếu cải thiện kết quả một cách chặt chẽ. Các chỉnh sửa bị từ chối sẽ được đưa vào bộ đệm phản hồi tiêu cực. Ngoài ra, còn sử dụng cập nhật chậm/siêu cập nhật để rút ra các bài học dài hạn. SkillOpt đã được kiểm tra trên sáu bộ benchmark (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) với bảy mô hình từ GPT-5.5 đến Qwen3.5-4B và trong ba chế độ thực thi (đối thoại, Codex, Claude Code). Phương pháp này đạt kết quả tốt nhất hoặc ngang bằng tốt nhất trong tất cả 52 ô đánh giá. Đối với GPT-5.5 trong chế độ đối thoại, điểm trung bình trên sáu bộ benchmark tăng từ 58,8 lên 82,3 (+23,5 điểm). Các cải thiện lớn nhất thuộc về các bộ benchmark thủ tục: SpreadsheetBench từ 41,8 lên 80,7, OfficeQA từ 33,1 lên 72,1, LiveMathematicianBench từ 37,6 lên 66,9. Các kỹ năng đã tối ưu hóa có thể được chuyển giao giữa các mô hình có kích thước khác nhau, môi trường thực thi và các tác vụ liên quan, cho thấy khả năng nắm bắt kiến thức thủ tục tổng quát. Ví dụ, kỹ năng làm việc với bảng tính, được huấn luyện trong Codex và chuyển sang Claude Code, đã nâng kết quả cơ sở từ 22,1 lên 81,8 (+59,7). Tệp kỹ năng cuối cùng nhỏ gọn (độ dài trung vị khoảng 920 token) và chứa từ một đến bốn thay đổi được chấp nhận. Phương pháp này có sẵn trong kho lưu trữ GitHub và trên trang dự án.
Nguồn: Microsoft Research —
bản gốc
