Alibaba ouvre Qwen2.5-VL-32B en open source : plus intelligent et plus léger
Alibaba/Qwen
Alibaba a publié en open source Qwen2.5-VL-32B-Instruct, un modèle de vision-langage de 32 milliards de paramètres, sous licence Apache 2.0. Il surpasse Mistral-Small-3.1-24B et Gemma-3-27B-IT, et dépasse même le plus grand Qwen2-VL-72B-Instruct sur des benchmarks de raisonnement multimodal comme MMMU et MathVista. Le modèle est optimisé par apprentissage par renforcement pour un meilleur alignement humain et un raisonnement mathématique amélioré.
L'équipe Qwen d'Alibaba a annoncé la sortie de Qwen2.5-VL-32B-Instruct, un modèle vision-langage de 32 milliards de paramètres, open sourcé sous licence Apache 2.0. Ce modèle s'appuie sur la série Qwen2.5-VL et est optimisé via l'apprentissage par renforcement. Les améliorations clés incluent des réponses mieux alignées sur les préférences humaines, une précision accrue en raisonnement mathématique, ainsi qu'une compréhension et un raisonnement fins des images. Lors de tests approfondis, Qwen2.5-VL-32B-Instruct surpasse les modèles de pointe (SoTA) comparables, tels que Mistral-Small-3.1-24B et Gemma-3-27B-IT, et dépasse même le modèle plus grand Qwen2-VL-72B-Instruct sur des tâches multimodales complexes comme MMMU, MMMU-Pro et MathVista. Il atteint également des performances de premier plan en capacités textuelles pures à la même échelle. L'équipe prévoit de se concentrer ensuite sur des processus de raisonnement longs et efficaces pour les tâches de raisonnement visuel hautement complexes.
Source: Alibaba Qwen —
original
