ModèlesOpen Source 🇨🇳 28.07.2026 18:03

Qwen2.5-LLM : repousser les limites des modèles de langage

Alibaba/QwenAlibaba/Qwen
L'équipe Qwen d'Alibaba a publié la série de modèles de langage Qwen2.5, comprenant sept modèles open source allant de 0,5 à 72 milliards de paramètres. Ces modèles disposent d'un ensemble de données de pré-entraînement plus vaste (jusqu'à 18 billions de tokens), de capacités améliorées en connaissances, codage et mathématiques, et prennent en charge des longueurs de contexte allant jusqu'à 128 000 tokens.
L'équipe Qwen d'Alibaba a annoncé la série de modèles de langage Qwen2.5, des modèles denses à décodeur seul. Sept modèles sont open-source : 0,5 milliard, 1,5 milliard, 3 milliards, 7 milliards, 14 milliards, 32 milliards et 72 milliards de paramètres. L'ensemble de données de pré-entraînement est passé de 7 billions à 18 billions de tokens. Comparé à Qwen2, Qwen2.5 montre des améliorations en MMLU, dans les benchmarks de codage (LiveCodeBench, MultiPL-E, MBPP) et dans les benchmarks mathématiques (MATH). Qwen2.5-72B surpasse Llama-3-405B sur plusieurs tâches tout en utilisant un cinquième des paramètres. Les modèles supplémentaires Qwen-Plus et Qwen-Turbo sont disponibles via l'API Alibaba Cloud Model Studio. La plupart des modèles sont sous licence Apache 2.0, à l'exception de Qwen2.5-3B et Qwen2.5-72B qui ont des licences distinctes.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches