Alibaba Lança Qwen2.5-Coder: Até 32B Parâmetros, Modelos de Código Open Source
Alibaba/Qwen
DeepSeek
Mistral
A equipe Qwen da Alibaba anuncia o Qwen2.5-Coder, uma série de modelos de código aberto de próxima geração nos tamanhos 1,5B, 7B e o futuro 32B, treinados em 5,5 trilhões de tokens. A versão 7B supera modelos maiores como DeepSeek-Coder-V2-Lite e CodeStral-22B em tarefas de código, mantendo fortes habilidades matemáticas e gerais.
A equipe Qwen da Alibaba lançou o Qwen2.5-Coder, sucessor do CodeQwen1.5, como parte da série Qwen2.5. Os modelos estão disponíveis em três tamanhos: 1,5B, 7B e uma versão de 32B em breve. Eles são treinados em 5,5 trilhões de tokens, incluindo código-fonte, dados de ancoragem texto-código e dados sintéticos, com dados adicionais de matemática e gerais para preservar habilidades não relacionadas a codificação. O modelo base suporta até 128 mil tokens de contexto, 92 linguagens de programação e alcança resultados de última geração em geração, conclusão, correção e benchmarks multilíngues de código. A versão de 7B supera o DeepSeek-Coder-V2-Lite e o CodeStral-22B em tarefas de código, e também apresenta desempenho competitivo em matemática nos benchmarks GSM8K e Math. A variante ajustada por instruções, Qwen2.5-Coder-Instruct, melhora ainda mais o desempenho em tarefas e a generalização, destacando-se em raciocínio de código multilíngue (McEval), raciocínio de código (CRUXEval) e raciocínio matemático (GSM8K, OlympiadBench). Também mantém fortes habilidades gerais no MMLU, CEval e outros benchmarks. Os modelos são lançados sob licença Apache 2.0. Os próximos passos incluem uma versão de 32B e a exploração de modelos de raciocínio centrados em código.
Fonte: Alibaba Qwen —
original
