Alibaba julkaisee Qwen-Image-mallin: 20 miljardin parametrin MMDiT-malli tarkan tekstin kuvantamiseen
Alibaba/Qwen
Alibaban Qwen-tiimi on julkaissut Qwen-Image-mallin, 20 miljardin parametrin MMDiT-kuvapohjamallin, joka loistaa monimutkaisessa tekstin renderöinnissä (mukaan lukien kaksikielinen kiina-englanti), johdonmukaisessa kuvien muokkauksessa ja saavuttaa vahvoja tuloksia vertailutesteissä, kuten GenEval ja DPG. Malli tukee julisteiden luontia, diojen tuottamista ja tarkan tekstin renderöintiä pienille alueille.
Alibaba Qwen -tiimi on julkaissut Qwen-Image -nimisen, 20 miljardin parametrin MMDiT-pohjaisen peruskuvamallin. Se saavuttaa alan huipputuloksia vertailuarvoissa, kuten GenEval, DPG, OneIG-Bench tuotannossa, GEdit, ImgEdit, GSO muokkauksessa sekä LongText-Bench, ChineseWord, TextCraft tekstin renderöinnissä. Malli on erinomainen renderöimään monirivistä tekstiä sekä aakkosellisissa kielissä (kuten englanti) että logografisissa kielissä (kuten kiina), mukaan lukien käsinkirjoitettu teksti, julisteet, PowerPoint-kalvot ja kaksikielinen sisältö. Se tukee myös johdonmukaisia kuvamuokkaustoimintoja, kuten tyylisiirtoa, kohteiden lisäämistä/poistamista ja tekstin muokkaamista. Malli pystyy renderöimään pientä tekstiä tarkasti, esimerkiksi paperilla olevan kappaleen, joka vie alle kymmenesosan kuvasta. Qwen-Image on saatavilla Qwen Chat -sovelluksessa sekä alustoilla, kuten GitHub, Hugging Face ja ModelScope.
Lähde: Alibaba Qwen —
Alkuperäinen
