Alibaba merilis Qwen-Image: model MMDiT 20 miliar parameter untuk pembuatan gambar akurat teks
Alibaba/Qwen
Tim Qwen dari Alibaba telah merilis Qwen-Image, model fondasi gambar MMDiT dengan 20 miliar parameter yang unggul dalam rendering teks kompleks (termasuk dwibahasa Mandarin-Inggris), pengeditan gambar konsisten, dan kinerja kuat di berbagai tolok ukur seperti GenEval dan DPG. Model ini mendukung pembuatan poster, pembuatan slide, dan rendering teks presisi di area kecil.
Tim Qwen dari Alibaba telah merilis Qwen-Image, sebuah model dasar gambar MMDiT dengan 20 miliar parameter. Model ini mencapai hasil terdepan pada tolok ukur seperti GenEval, DPG, OneIG-Bench untuk pembuatan gambar, serta GEdit, ImgEdit, GSO untuk penyuntingan, dan LongText-Bench, ChineseWord, TextCraft untuk rendering teks. Model ini unggul dalam merender teks multi-baris yang kompleks, baik dalam bahasa alfabetis (misalnya, Inggris) maupun bahasa logografis (misalnya, Tionghoa), termasuk teks tulisan tangan, poster, slide PPT, dan konten bilingual. Model ini juga mendukung operasi penyuntingan gambar yang konsisten seperti transfer gaya, penambahan/penghapusan objek, dan penyuntingan teks. Model ini dapat merender teks kecil secara akurat, misalnya paragraf di atas kertas yang menempati kurang dari sepersepuluh gambar. Qwen-Image tersedia melalui Qwen Chat dan di platform seperti GitHub, Hugging Face, dan ModelScope.
Sumber: Alibaba Qwen —
asli
