Alibaba publie Qwen2.5-Coder : jusqu'à 32 milliards de paramètres, modèles de code open source
Alibaba/Qwen
DeepSeek
Mistral
L'équipe Qwen d'Alibaba annonce Qwen2.5-Coder, une nouvelle génération de modèles de code open source disponibles en versions 1,5 milliard, 7 milliards, et bientôt 32 milliards de paramètres, entraînés sur 5,5 billions de tokens. La version 7 milliards dépasse des modèles plus volumineux comme DeepSeek-Coder-V2-Lite et CodeStral-22B sur des tâches de code, tout en conservant de solides capacités en mathématiques et générales.
L'équipe Qwen d'Alibaba a publié Qwen2.5-Coder, le successeur de CodeQwen1.5, dans le cadre de la série Qwen2.5. Les modèles sont disponibles en trois tailles : 1,5B, 7B, et une version 32B à venir. Ils sont entraînés sur 5,5 billions de tokens, incluant du code source, des données de mise en correspondance texte-code, et des données synthétiques, avec des données supplémentaires en mathématiques et données générales pour préserver les capacités non liées au codage. Le modèle de base prend en charge jusqu'à 128 000 tokens de contexte, 92 langages de programmation, et atteint des résultats de pointe en génération, complétion, réparation de code, et sur des benchmarks multilingues. La version 7B surpasse DeepSeek-Coder-V2-Lite et CodeStral-22B sur les tâches de code, et montre également des performances compétitives en mathématiques sur les évaluations GSM8K et Math. La variante optimisée par instructions, Qwen2.5-Coder-Instruct, améliore encore les performances et la généralisation, excellant en raisonnement de code multilingue (McEval), raisonnement de code (CRUXEval), et raisonnement mathématique (GSM8K, OlympiadBench). Elle maintient également de solides capacités générales sur MMLU, CEval, et d'autres benchmarks. Les modèles sont publiés sous licence Apache 2.0. Les prochaines étapes incluent une version 32B et l'exploration de modèles de raisonnement centrés sur le code.
Source: Alibaba Qwen —
original
