Qwen-Image: Beeldgeneratiemodel met Nauwkeurige Tekstweergave
Alibaba/Qwen
Alibaba heeft Qwen-Image uitgebracht, een fundamenteel beeldgeneratiemodel met 20 miljard parameters. Het presteert beter dan concurrenten bij het weergeven van complexe tekst, waaronder meerregelige bijschriften en Chinese karakters, en ondersteunt nauwkeurige beeldbewerking.
Het bedrijf Alibaba (via de divisie Qwen) heeft Qwen-Image aangekondigd, een fundamenteel model voor beeldgeneratie met een MMDiT-architectuur en 20 miljard parameters. Belangrijke mogelijkheden zijn onder meer uitstekende tekstweergave (ondersteuning voor meerregelige lay-outs, alinea's, alfabetische en logografische talen), consistente beeldbewerking met behoud van semantiek en realisme, en sterke prestaties op openbare benchmarks (GenEval, DPG, OneIG-Bench, GEdit, ImgEdit, GSO, LongText-Bench, ChineseWord, TextCraft) — het model overtreft bestaande alternatieven. In demonstraties worden voorbeelden getoond van nauwkeurige weergave van Chinese karakters op borden, rollen, boeken, posters, evenals Engelse teksten (inclusief lange fragmenten in een kleine ruimte). Het model ondersteunt het maken van posters, presentaties, werken met verschillende artistieke stijlen en bewerkingen (stylisering, toevoegen/verwijderen van objecten, tekst- en pose-aanpassingen).
Bron: Alibaba Qwen —
origineel
