ModèlesGénération Média 🇨🇳 27.07.2026 17:05

Alibaba dévoile Qwen-Image : un modèle MMDiT de 20 milliards de paramètres pour la génération d'images textuellement précise

Alibaba/QwenAlibaba/Qwen
L'équipe Qwen d'Alibaba a dévoilé Qwen-Image, un modèle fondamental d'image MMDiT de 20 milliards de paramètres qui excelle dans le rendu de texte complexe (y compris bilingue chinois-anglais), l'édition d'images cohérente et obtient de solides performances sur des références comme GenEval et DPG. Le modèle prend en charge la création d'affiches, la génération de diapositives et un rendu précis du texte sur de petites zones.
L'équipe Qwen d'Alibaba a dévoilé Qwen-Image, un modèle de base d'image MMDiT de 20 milliards de paramètres. Il obtient des résultats de pointe sur des benchmarks tels que GenEval, DPG, OneIG-Bench pour la génération, GEdit, ImgEdit, GSO pour l'édition, et LongText-Bench, ChineseWord, TextCraft pour le rendu de texte. Le modèle excelle dans le rendu de textes multilingues complexes, à la fois pour les langues alphabétiques (par exemple, l'anglais) et les langues logographiques (par exemple, le chinois), y compris le texte manuscrit, les affiches, les diapositives PPT et le contenu bilingue. Il prend également en charge des opérations d'édition d'image cohérentes telles que le transfert de style, l'ajout/suppression d'objets et l'édition de texte. Le modèle peut restituer avec précision de petits textes, comme un paragraphe sur un papier occupant moins d'un dixième de l'image. Qwen-Image est disponible via Qwen Chat et sur des plateformes comme GitHub, Hugging Face et ModelScope.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches