Qwen2-VL : Alibaba dévoile une nouvelle génération de modèles vision-langage aux performances de pointe
Alibaba/Qwen
Alibaba a présenté Qwen2-VL, une nouvelle génération de modèles vision-langage qui dépasse largement son prédécesseur en matière de compréhension d'images, de vidéos et de capacités agentives multimodales. Les modèles 2B et 7B sont ouverts sous licence Apache 2.0, tandis que le 72B est accessible via API. Le Qwen2-VL-72B affiche des performances supérieures à GPT-4o et Claude 3.5-Sonnet sur de nombreux benchmarks, notamment pour la compréhension de documents.
Alibaba a lancé Qwen2-VL, une nouvelle génération de modèles vision-langage basés sur Qwen2. Les modèles 2B et 7B sont ouverts sous licence Apache 2.0, tandis que le 72B est accessible via API. Qwen2-VL atteint des résultats de pointe sur les benchmarks MathVista, DocVQA, RealWorldQA et MTVQA. Le modèle est capable de comprendre des vidéos de plus de 20 minutes et de s'intégrer à des dispositifs pour des opérations automatiques. Il prend en charge le multilinguisme, y compris les langues européennes, le japonais, le coréen, l'arabe et le vietnamien. Qwen2-VL utilise un Vision Transformer avec 600 millions de paramètres et prend en charge la résolution dynamique. Un encodage positionnel multimodal, M-ROPE, a été introduit pour capturer simultanément les informations textuelles, visuelles et vidéo. Le modèle montre une supériorité dans la compréhension de documents et la résolution de problèmes, surpassant GPT-4o et Claude 3.5-Sonnet. Limitations du modèle : absence d'extraction audio à partir de vidéos, connaissances datant de juin 2023, difficultés de comptage et de reconnaissance de symboles.
Source: Alibaba Qwen —
original
