Alibaba lança Qwen-Image: um modelo MMDiT de 20B para geração de imagens com texto preciso
Alibaba/Qwen
A equipe Qwen da Alibaba lançou o Qwen-Image, um modelo fundacional de imagem MMDiT de 20 bilhões de parâmetros que se destaca na renderização de texto complexo (incluindo bilíngue chinês-inglês), edição consistente de imagens e forte desempenho em benchmarks como GenEval e DPG. O modelo suporta criação de pôsteres, geração de slides e renderização precisa de texto em pequenas regiões.
A equipe Qwen da Alibaba lançou o Qwen-Image, um modelo de imagem fundamental MMDiT de 20 bilhões de parâmetros. Ele alcança resultados de última geração em benchmarks como GenEval, DPG, OneIG-Bench para geração, e GEdit, ImgEdit, GSO para edição, além de LongText-Bench, ChineseWord, TextCraft para renderização de texto. O modelo é excelente na renderização de texto multiline complexo tanto em idiomas alfabéticos (por exemplo, inglês) quanto em idiomas logográficos (por exemplo, chinês), incluindo texto manuscrito, cartazes, slides de PowerPoint e conteúdo bilíngue. Ele também suporta operações de edição de imagem consistentes, como transferência de estilo, adição/remoção de objetos e edição de texto. O modelo pode renderizar com precisão texto pequeno, como um parágrafo em um papel ocupando menos de um décimo da imagem. O Qwen-Image está disponível via Qwen Chat e em plataformas como GitHub, Hugging Face e ModelScope.
Fonte: Alibaba Qwen —
original
