проходе замороженная модель выполняет обучающие задачи; на обратном проходе модель-оптимизатор анализирует траектории; шаг обновления предлагает ограниченные правки, управляемые проверкой валидации. Отклонённые правки сохраняются для обратной связи, а медленное/мета-обновление консолидирует долгосрочные уроки. Оценённый на шести бенчмарках (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) с семью целевыми моделями (от GPT-5.5 до Qwen3.5-4B) и тремя режимами выполнения (прямой чат, Codex, Claude Code), SkillOpt достиг лучших или равных лучшим результатов во всех 52 ячейках. Для GPT-5.5 в прямом чате средний показатель по шести бенчмаркам вырос с 58,8 до 82,3 (+23,5 пункта). Наибольший прирост наблюдался на процедурных бенчмарках: SpreadsheetBench с 41,8 до 80,7, OfficeQA с 33,1 до 72,1 и LiveMathematicianBench с 37,6 до 66,9. Оптимизированные навыки переносились между масштабами моделей, средами выполнения и связанными задачами; например, навык работы с электронными таблицами, обученный в Codex, при переносе в Claude Code улучшил базовый показатель без навыка с 22,1 до 81,8 (+59,7). Итоговые файлы навыков оставались компактными (медиана ~920 токенов) с всего 1–4 принятыми правками. SkillOpt предполагает, что обучение может применяться к процедурным знаниям вне весов модели, предлагая контролируемый и аудируемый слой адаптации для агентных рабочих процессов.