ModèlesGénération Média 🇨🇳 27.07.2026 17:05

Qwen-Image : modèle de génération d'images avec rendu précis du texte

Alibaba/QwenAlibaba/Qwen
Alibaba a dévoilé Qwen-Image, un modèle fondamental de génération d'images de 20 milliards de paramètres. Il surpasse ses concurrents dans le rendu de texte complexe, y compris les légendes multi-lignes et les caractères chinois, et prend en charge une édition d'image précise.
Alibaba (via sa filiale Qwen) a annoncé Qwen-Image, un modèle fondamental de génération d'images basé sur l'architecture MMDiT avec 20 milliards de paramètres. Ses capacités clés incluent un rendu de texte exceptionnel (prise en charge de mises en page multi-lignes, de paragraphes, de langues alphabétiques et logographiques), une édition d'images cohérente préservant la sémantique et le réalisme, ainsi que des performances solides sur des benchmarks publics (GenEval, DPG, OneIG-Bench, GEdit, ImgEdit, GSO, LongText-Bench, ChineseWord, TextCraft) – le modèle surpassant les solutions existantes. Les démonstrations montrent des exemples de reproduction précise de caractères chinois sur des panneaux, des rouleaux, des livres, des affiches, ainsi que de textes anglais (y compris de longs passages dans des espaces réduits). Le modèle prend en charge la création d'affiches, de présentations, le travail avec différents styles artistiques et des opérations d'édition (stylisation, ajout/suppression d'objets, modification de texte et de poses).
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches