Qwen2.5 : une fête de modèles fondamentaux !
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
L'équipe Qwen d'Alibaba annonce la publication open source des LLM Qwen2.5, ainsi que des modèles spécialisés pour le codage (Qwen2.5-Coder) et les mathématiques (Qwen2.5-Math). Les modèles vont de 0,5 à 72 milliards de paramètres, pré-entraînés sur jusqu'à 18 billions de tokens, avec des améliorations significatives dans les connaissances, le codage et les capacités mathématiques. La publication inclut également les modèles API Qwen-Plus et Qwen-Turbo.
L'équipe Qwen d'Alibaba a publié Qwen2.5, une famille de modèles de langage décodeurs-only open source, ainsi que des modèles spécialisés Qwen2.5-Coder et Qwen2.5-Math. Les modèles sont disponibles en tailles allant de 0,5B à 72B paramètres, pré-entraînés sur jusqu'à 18 billions de tokens. Qwen2.5 obtient un score MMLU supérieur à 85, HumanEval supérieur à 85, et MATH supérieur à 80, prend en charge jusqu'à 128 000 tokens de contexte et 8 000 tokens de génération, et offre un support multilingue pour plus de 29 langues. Qwen2.5-Coder a été entraîné sur 5,5 billions de tokens de données de code, tandis que Qwen2.5-Math prend en charge le raisonnement CoT, PoT, and TIR (c'est-à-dire chaîne de pensée, programme de pensée et raisonnement par interprétation de texte). Les modèles API phares Qwen-Plus et Qwen-Turbo sont également proposés. Les variantes 3B et 72B ne sont pas sous licence Apache 2.0.
Source: Alibaba Qwen —
original
