Alibaba, Qwen-Image'ı yayınladı: metin doğruluğu yüksek görsel üretim için 20 milyar parametreli MMDiT modeli
Alibaba/Qwen
Alibaba'nın Qwen ekibi, karmaşık metin oluşturma (iki dilli Çince-İngilizce dahil), tutarlı görsel düzenleme ve GenEval ile DPG gibi kıyaslamalarda güçlü performans gösteren 20 milyar parametreli MMDiT görsel temel modeli Qwen-Image'ı yayınladı. Model, poster oluşturma, slayt üretimi ve küçük bölgelerde hassas metin oluşturmayı destekliyor.
Alibaba'nın Qwen ekibi, 20 milyar parametreli MMDiT (Multimodal Diffusion Transformer) tabanlı bir görüntü temel modeli olan Qwen-Image'ı yayınladı. Model, üretim için GenEval, DPG, OneIG-Bench; düzenleme için GEdit, ImgEdit, GSO; ve metin oluşturma için LongText-Bench, ChineseWord, TextCraft gibi kıyaslamalarda en son teknoloji sonuçlarına ulaşıyor. Model, hem alfabetik dillerde (örneğin İngilizce) hem de logografik dillerde (örneğin Çince) karmaşık çok satırlı metinleri, el yazısı metinler, posterler, PowerPoint slaytları ve iki dilli içerik dahil olmak üzere başarıyla oluşturuyor. Ayrıca stil aktarımı, nesne ekleme/silme ve metin düzenleme gibi tutarlı görüntü düzenleme işlemlerini de destekliyor. Model, görüntünün onda birinden azını kaplayan bir kağıt üzerindeki paragraf gibi küçük metinleri doğru bir şekilde oluşturabiliyor. Qwen-Image, Qwen Chat ve GitHub, Hugging Face, ModelScope gibi platformlar üzerinden kullanıma sunuldu.
Kaynak: Alibaba Qwen —
orijinal
