ModèlesOpen Source 🇨🇳 28.07.2026 16:03

Alibaba a lancé Qwen2.5-VL : un nouveau modèle multimodal phare

Alibaba/QwenAlibaba/Qwen
Alibaba a dévoilé Qwen2.5-VL, une nouvelle génération de modèle vision-langage, disponible en tailles 3B, 7B et 72B. Le modèle se distingue par une compréhension visuelle améliorée, la prise en charge de vidéos de plus d'une heure, la capacité à effectuer des actions agentives et une sortie structurée.
Le groupe Qwen d’Alibaba a dévoilé Qwen2.5-VL, un nouveau modèle phare pour la vision et le langage. Il est disponible en trois tailles – 3B, 7B et 72B – en versions « base » et « instruct », sur Hugging Face et ModelScope. Le modèle peut reconnaître des objets, des textes, des diagrammes et fonctionner comme un agent visuel, capable de contrôler un ordinateur ou un téléphone. Il comprend des vidéos de plus d’une heure et peut localiser des événements dans le temps. Le modèle permet une localisation précise des objets à l’aide de boîtes englobantes et de points clés, ainsi qu’une sortie structurée en JSON pour les documents, factures et tableaux. Le modèle phare Qwen2.5-VL-72B-Instruct affiche des résultats compétitifs sur les bancs d’essai, y compris des tâches de niveau universitaire, des mathématiques, de la compréhension de documents et de vidéos. Les versions plus petites (7B) surpassent GPT-4o-mini sur plusieurs tâches, tandis que la version 3B, conçue pour l’inférence en périphérie, dépasse le précédent modèle 7B. La reconnaissance d’images a également été améliorée : le modèle couvre désormais un très grand nombre de catégories, notamment les plantes, les animaux, les sites touristiques, les personnages de films et les produits. Le modèle utilise le format HTML pour baliser les documents (QwenVL HTML).
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches