Alibaba выпускает Qwen-Image: модель MMDiT с 20 миллиардами параметров для генерации изображений с точным текстом
Alibaba/Qwen
Команда Qwen из Alibaba выпустила Qwen-Image — базовую модель изображений MMDiT с 20 миллиардами параметров, которая отлично справляется со сложным рендерингом текста (включая двуязычный китайско-английский), согласованным редактированием изображений и демонстрирует высокие результаты в бенчмарках, таких как GenEval и DPG. Модель поддерживает создание постеров, генерацию слайдов и точный рендеринг текста на малых областях.
Команда Qwen из Alibaba представила Qwen-Image — фундаментальную модель изображений на основе MMDiT с 20 миллиардами параметров. Она достигает передовых результатов на таких бенчмарках, как GenEval, DPG, OneIG-Bench для генерации, GEdit, ImgEdit, GSO для редактирования, а также LongText-Bench, ChineseWord, TextCraft для рендеринга текста. Модель отлично справляется с выводом сложного
Показать ещё ↓
Источник: Alibaba Qwen —
оригинал
