ModelleMediengenerierung 🇨🇳 27.07.2026 17:05

Alibaba veröffentlicht Qwen-Image: ein 20B MMDiT-Modell für textgenaue Bildgenerierung

Alibaba/QwenAlibaba/Qwen
Das Qwen-Team von Alibaba hat Qwen-Image veröffentlicht, ein 20 Milliarden Parameter umfassendes MMDiT-Bildfundamentmodell, das sich durch komplexe Textdarstellung (einschließlich zweisprachigem Chinesisch-Englisch), konsistente Bildbearbeitung und starke Leistung in Benchmarks wie GenEval und DPG auszeichnet. Das Modell unterstützt die Erstellung von Postern, die Generierung von Folien und die präzise Textdarstellung in kleinen Bereichen.
Das Qwen-Team von Alibaba hat Qwen-Image veröffentlicht, ein Bild-Grundlagenmodell mit 20 Milliarden Parametern auf Basis von MMDiT. Es erzielt Spitzenergebnisse in Benchmarks wie GenEval, DPG und OneIG-Bench für die Generierung, GEdit, ImgEdit und GSO für die Bearbeitung sowie LongText-Bench, ChineseWord und TextCraft für die Textwiedergabe. Das Modell zeichnet sich durch die Wiedergabe von komplexem mehrzeiligem Text sowohl in alphabetischen Sprachen (z. B. Englisch) als auch in logografischen Sprachen (z. B. Chinesisch) aus, einschließlich handschriftlichem Text, Postern, PPT-Folien und zweisprachigen Inhalten. Es unterstützt zudem konsistente Bildbearbeitungsoperationen wie Stilübertragung, Hinzufügen/Entfernen von Objekten und Textbearbeitung. Das Modell kann kleinen Text präzise darstellen, etwa einen Absatz auf einem Papier, der weniger als ein Zehntel des Bildes einnimmt. Qwen-Image ist über Qwen Chat und auf Plattformen wie GitHub, Hugging Face und ModelScope verfügbar.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten