Qwen2.5-Coder: пиши код больше, учись лучше!
Alibaba/Qwen
Alibaba Qwen представила новое поколение открытых моделей для кодинга Qwen2.5-Coder, доступных в размерах 1,5B, 7B и 32B (скоро). Модель обучена на 5,5 трлн токенов, поддерживает 92 языка программирования и контекст до 128K токенов. Версия 7B превзошла DeepSeek-Coder-V2-Lite и CodeStral-22B по задачам генерации кода, а её инструктивная версия превосходит аналоги в математических и общих бенчмарках. Модель выпущена под лицензией Apache 2.0.
Команда Alibaba Qwen анонсировала Qwen2.5-Coder — новое поколение открытых моделей для кодирования, которое приходит на смену CodeQwen1.5. Модели доступны в трёх размерах: 1,5B, 7B, а версия 32B выйдет позже. Qwen2.5-Coder основана на Qwen2.5 и дообучена на 5,5 триллионах токенов, включающих исходный код, данные о связи текста с кодом и синтетические данные. Модель поддерживает до 128 тысяч токенов контекста и 92 языка программирования. В бенчмарках кода (генерация, завершение, исправление) версия 7B превзошла более крупные модели DeepSeek-Coder-V2-Lite и CodeStral-22B. Помимо кода, модель сохраняет высокую производительность в математике (GSM8K, Math) и общих задачах (MMLU, ARC). Инструктивная версия Qwen2.5-Coder-Instruct дополнительно улучшена на инструктивных данных и показывает выдающиеся результаты в многоязычном кодировании (McEval — более 40 языков), рассуждениях о коде (CRUXEval), математике (OlympiadBench, AIME24) и общих способностях (MMLU-Pro, IFEval, CEval, GPQA). Модель выпущена под лицензией Apache 2.0. В планах: выпуск версии 32B и создание мощных моделей рассуждения, ориентированных на код.
Источник: Alibaba Qwen —
оригинал
