ModèlesRecherche 🇨🇳 28.07.2026 19:03

Qwen2-VL : Alibaba dévoile une nouvelle génération de modèles vision-langage avec des performances SoTA

Alibaba/QwenAlibaba/Qwen
Alibaba a présenté Qwen2-VL, une nouvelle génération de modèles vision-langage qui surpassent nettement leur prédécesseur en matière de compréhension d'images, de vidéos et de capacités agentives multimodales. Les modèles 2B et 7B sont ouverts sous licence Apache 2.0, tandis que le 72B est accessible via API. Le Qwen2-VL-72B offre des performances supérieures à GPT-4o et Claude 3.5-Sonnet sur de nombreux benchmarks, notamment en compréhension de documents.
Alibaba a lancé Qwen2-VL, une nouvelle génération de modèles vision-langage basés sur Qwen2. Les modèles 2B et 7B sont ouverts sous licence Apache 2.0, tandis que le 72B est accessible via API. Qwen2-VL atteint des résultats de pointe sur les benchmarks MathVista, DocVQA, RealWorldQA et MTVQA. Le modèle est capable de comprendre des vidéos de plus de 20 minutes et de s'intégrer à des dispositifs pour des opérations automatiques. Il prend en charge le multilinguisme, y compris les langues européennes, le japonais, le coréen, l'arabe et le vietnamien. Qwen2-VL utilise un Vision Transformer avec 600 millions de paramètres et prend en charge la résolution dynamique. Un encodage positionnel multimodal, M-ROPE, a été introduit pour capturer simultanément les informations textuelles, visuelles et vidéo. Le modèle montre une supériorité dans la compréhension de documents et la résolution de problèmes, surpassant GPT-4o et Claude 3.5-Sonnet. Limitations du modèle : absence d'extraction audio à partir de vidéos, connaissances datant de juin 2023, difficultés de comptage et de reconnaissance de symboles.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches