Alibaba lanza Qwen-Image: un modelo MMDiT de 20 mil millones de parámetros para generación de imágenes con precisión textual
Alibaba/Qwen
El equipo Qwen de Alibaba ha lanzado Qwen-Image, un modelo fundacional de imágenes MMDiT de 20 mil millones de parámetros que sobresale en la representación de texto complejo (incluyendo bilingüe chino-inglés), edición consistente de imágenes y un sólido rendimiento en puntos de referencia como GenEval y DPG. El modelo admite creación de pósteres, generación de diapositivas y representación precisa de texto en regiones pequeñas.
El equipo Qwen de Alibaba ha lanzado Qwen-Image, un modelo fundacional de imágenes basado en MMDiT con 20 mil millones de parámetros. Alcanza resultados de última generación en puntos de referencia como GenEval, DPG y OneIG-Bench para generación; GEdit, ImgEdit y GSO para edición; y LongText-Bench, ChineseWord y TextCraft para renderizado de texto. El modelo destaca en la representación de texto multilínea complejo tanto en idiomas alfabéticos (por ejemplo, inglés) como logográficos (por ejemplo, chino), incluyendo texto manuscrito, carteles, diapositivas de presentaciones y contenido bilingüe. También admite operaciones consistentes de edición de imágenes como transferencia de estilo, adición o eliminación de objetos y edición de texto. El modelo puede representar con precisión texto pequeño, como un párrafo en un papel que ocupa menos de una décima parte de la imagen. Qwen-Image está disponible a través de Qwen Chat y en plataformas como GitHub, Hugging Face y ModelScope.
Fuente: Alibaba Qwen —
original
