АгентыМодели 🇷🇺 20.07.2026 15:03

Как мы собирали трейсы для обучения агентских навыков компактных языковых моделей Cotype

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Компания Cotype (независимая разработка) представила третье поколение своих языковых моделей: флагманскую Cotype Pro 3 (27 млрд параметров) и облегчённую Cotype Light 3 (9 млрд). Для обучения моделей многошаговым сценариям с вызовом инструментов был разработан пайплайн на основе τ²-bench, где каждый вызов инструмента исполняется в реальной базе данных, а не имитируется. Это позволяет собирать достоверные трейсы ошибок и восстановления. Дообучение модели Qwen3.5-9B методом GRPO повысило основную метрику с 0,794 до 0,856 на отложенном тесте в телекоме, финансах и HR.
Разработчики моделей Cotype (Cotype Pro 3 — 27 млрд параметров и Cotype Light 3 — 9 млрд) столкнулись с проблемой: компактные языковые модели плохо справляются с многошаговыми задачами, требующими вызова инструментов, — они могут повторять упавшие вызовы вместо выбора обходного пути или терять идентификаторы между шагами. Чтобы научить модели корректно выполнять такие сценарии, был создан пайплайн сбора трейсов на основе открытого фреймворка τ²-bench (tau2). Пайплайн включает два этапа: подготовка среды (LLM проектирует домены, базу данных, инструменты и политику) и генерация трейсов, где две LLM (агент и клиент) разыгрывают диалог. Каждый вызов инструмента, предложенный агентом, реально исполняется в базе, возвращая фактические результаты, ошибки и статусы. Это гарантирует, что трейсы содержат настоящие ошибки и восстановления, а не выдуманные сценарии. Собранные трейсы покрывают пять классов ошибок: перенос данных через контекст (40%), ветвление по состоянию (25%), действие без лишних уточнений (20%), восстановление после ошибки инструмента (10%), корректное завершение диалога (5%). Эксперимент с дообучением Qwen3.5-9B (9 млрд параметров) на этих трейсах методом GRPO показал улучшение основной метрики на отложенном тесте (90 задач из телекома, финансов и HR, по 5 прогонов каждая) с 0,794 до 0,856. Прирост особенно заметен в автономных задачах (ST: с 0,727 до 0,821).
Сокращения
LLM = Large Language Model — большая языковая модель
RL = Reinforcement Learning — обучение с подкреплением
GRPO = Group Relative Policy Optimization — групповая оптимизация политики
SFT = Supervised Fine-Tuning — обучение с учителем
DPO = Direct Preference Optimization — прямая оптимизация предпочтений
Источник: Habr — хаб ИИ — оригинал

Наши прошлые публикации по теме

Есть свежие новости