Mô hìnhTác tử 🇺🇸 26.07.2026 14:01

KwaiKAT Team Launches KAT-Coder-V2.5: An Agentic Model for Programming Trained on Over 100,000 Verifiable Repositories

AnthropicAnthropic
The KwaiKAT team from Kuaishou has released KAT-Coder-V2.5, an agentic coding model trained to operate in real-world repositories. Using AutoBuilder, they successfully created over 100,000 verifiable environments across 12 languages. The model leads the PinchBench benchmark with a score of 94.9 and ranks second on SWE-Bench Pro (65.2). An open version, KAT-Coder-V2.5-Dev, is available on Hugging Face.
Команда KwaiKAT из компании Kuaishou представила модель KAT-Coder-V2.5 (Agile Coding Tool Coder). Это агентная модель для программирования, обученная работать внутри реальных исполняемых репозиториев, а не выдавать одноразовый код. Модель доступна через StreamLake; открытая версия KAT-Coder-V2.5-Dev выпущена на Hugging Face под лицензией Apache-2.0. Исследователи разработали AutoBuilder — систему, которая автоматически создаёт проверяемые среды для задач. Задача описывается тройкой: описание задачи, исполняемая среда репозитория и набор проверочных тестов. Исправление считается верным, только если проходит все тесты. Задачи извлекаются из реальных pull request'ов и коммитов, а сырой текст issue отбрасывается — вместо него генерируется структурированное описание. AutoBuilder включает агента сборки, который анализирует репозиторий и пишет скрипт конфигурации, и агента верификации, который выполняет скрипт в изолированной песочнице. Приёмка среды происходит, когда более 90% ожидаемых тестов собраны и результаты прохождения/непрохождения воспроизводятся. Комбинация предварительно настроенной базовой среды, шаблонов сборки и библиотеки рецептов повысила успешность сборки с 16,5% до 57,2%, в результате получено более 100 000 проверяемых сред на 12 языках. Для фильтрации траекторий обучения используются три механизма: подсказки для «почти успешных» траекторий, правящие проверки для успешных, и рандомизация инструментов для предотвращения переобучения. Инфраструктурные проблемы песочницы были выявлены при аудите: около 16% траекторий обучения с подкреплением терпели неудачу из-за ошибок песочницы, а не политики модели. После исправлений (оптимизация использования диска, корректировка переменных окружения, обход стандартных чат-эндпоинтов) частота ошибок снизилась ниже 2%. Для обучения использован асимметричный PPO с тремя уровнями вознаграждения: основные баллы за тесты, штрафы за нарушение поведения и поощрения за неудачные траектории. Пять экспертов объединены через Multi-Teacher On-Policy Distillation с использованием обратной KL-дивергенции. На бенчмарке PinchBench KAT-Coder-V2.5 набрала 94,9, опередив Opus 4.8 (93,5). На SWE-Bench Pro она заняла второе место с 65,2 (Opus 4.8 — 69,2). На Terminal-Bench 2.1 модель показала 60,7 (последнее место), а на SciCode — 50,3, сравнявшись с GLM-5.2. Открытая версия KAT-Coder-V2.5-Dev — это отдельная модель MoE (35B всего / 3B активных), дообученная на Qwen3.6-35B-A3B с 127 тысячами SFT-примеров и обучением с подкреплением; её результаты не сравнимы с основной таблицей.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới