ModèlesGénération Média 🇨🇳 27.07.2026 18:04

Qwen VLo : modèle unifié de compréhension et de génération multimodales d'Alibaba

Alibaba/QwenAlibaba/Qwen
Alibaba publie Qwen VLo, un modèle multimodal unifié qui comprend et génère des images. Il prend en charge l'édition libre, les instructions multilingues, la résolution dynamique et la génération progressive de haut en bas et de gauche à droite. Disponible en aperçu sur Qwen Chat.
Alibaba présente Qwen VLo, un nouveau modèle multimodal unifié capable à la fois de comprendre et de générer des images. Ce modèle, qui constitue une amélioration par rapport à la série précédente QwenVL, fait le lien entre perception et création. Il utilise une méthode de génération progressive, construisant les images de gauche à droite et de haut en bas. Qwen VLo prend en charge une compréhension précise du contenu, l'édition basée sur des instructions ouvertes (transfert de style, modification d'objets, changement d'arrière-plan), des instructions multilingues (chinois et anglais), ainsi qu'une résolution dynamique avec des proportions arbitraires. Il peut également effectuer des tâches de perception visuelle telles que la prédiction de cartes de profondeur, la segmentation et la détection de contours via des commandes d'édition. Le modèle est en phase de prévisualisation et disponible via Qwen Chat. Parmi les limitations, on note des imprécisions et incohérences occasionnelles.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches