ModelleMediengenerierung 🇨🇳 27.07.2026 17:05

Qwen-Image: Bildgenerierungsmodell mit präziser Textwiedergabe

Alibaba/QwenAlibaba/Qwen
Alibaba hat Qwen-Image veröffentlicht, ein grundlegendes Bildgenerierungsmodell mit 20 Milliarden Parametern. In der komplexen Textwiedergabe, einschließlich mehrzeiliger Bildunterschriften und chinesischer Schriftzeichen, übertrifft es die Konkurrenz und unterstützt präzise Bildbearbeitung.
Alibaba hat über seine Tochtergesellschaft Qwen Qwen-Image vorgestellt – ein fundamentales Bildgenerierungsmodell mit MMDiT-Architektur und 20 Milliarden Parametern. Zu den wichtigsten Funktionen gehören hervorragende Textdarstellung (Unterstützung für mehrzeilige Layouts, Absätze, alphabetische und logografische Sprachen), konsistente Bildbearbeitung unter Wahrung von Semantik und Realismus sowie eine starke Leistung in öffentlichen Benchmarks (GenEval, DPG, OneIG-Bench, GEdit, ImgEdit, GSO, LongText-Bench, ChineseWord, TextCraft) – das Modell übertrifft bestehende Alternativen. In Demonstrationen wurden Beispiele für die präzise Wiedergabe chinesischer Schriftzeichen auf Schildern, Schriftrollen, Büchern und Plakaten sowie englischer Texte (einschließlich langer Passagen auf engem Raum) gezeigt. Das Modell unterstützt die Erstellung von Postern und Präsentationen, arbeitet mit verschiedenen Kunststilen und bietet Bearbeitungsfunktionen wie Stilisierung, Hinzufügen/Entfernen von Objekten sowie Ändern von Text und Posen.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten