ModelosGeração de Mídia 🇨🇳 27.07.2026 17:05

Qwen-Image: Modelo de Geração de Imagens com Renderização Precisa de Texto

Alibaba/QwenAlibaba/Qwen
A Alibaba lançou o Qwen-Image, um modelo fundamental de geração de imagens com 20 bilhões de parâmetros. Ele supera os concorrentes na renderização complexa de texto, incluindo legendas de várias linhas e caracteres chineses, e suporta edição precisa de imagens.
A Alibaba (por meio de sua divisão Qwen) anunciou o Qwen-Image, um modelo fundamental de geração de imagens com arquitetura MMDiT e 20 bilhões de parâmetros. As principais capacidades incluem renderização superior de texto (suporte para layouts multilinha, parágrafos, idiomas alfabéticos e logográficos), edição consistente de imagens com preservação de semântica e realismo, além de desempenho robusto em benchmarks públicos (GenEval, DPG, OneIG-Bench, GEdit, ImgEdit, GSO, LongText-Bench, ChineseWord, TextCraft) — o modelo supera as alternativas existentes. As demonstrações mostram exemplos de reprodução precisa de caracteres chineses em placas, rolos de papel, livros, cartazes, bem como textos em inglês (incluindo longos trechos em espaços reduzidos). O modelo suporta criação de cartazes, apresentações, trabalho com diferentes estilos artísticos e operações de edição (estilização, adição/remoção de objetos, alteração de texto e pose).
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas