ModellenMediageneratie 🇨🇳 27.07.2026 17:05

Alibaba brengt Qwen-Image uit: een 20B MMDiT-model voor tekstnauwkeurige beeldgeneratie

Alibaba/QwenAlibaba/Qwen
Alibaba's Qwen-team heeft Qwen-Image uitgebracht, een beeldbasismodel met 20 miljard parameters en MMDiT-architectuur dat uitblinkt in complexe tekstweergave (inclusief tweetalig Chinees-Engels), consistente beeldbewerking en sterke prestaties op benchmarks zoals GenEval en DPG. Het model ondersteunt het maken van posters, het genereren van dia's en nauwkeurige tekstweergave in kleine regio's.
Het Qwen-team van Alibaba heeft Qwen-Image uitgebracht, een MMDiT-beeld-funderingsmodel met 20 miljard parameters. Het behaalt state-of-the-art resultaten op benchmarks zoals GenEval, DPG, OneIG-Bench voor generatie, GEdit, ImgEdit, GSO voor bewerking, en LongText-Bench, ChineseWord, TextCraft voor tekstweergave. Het model blinkt uit in het weergeven van complexe meerregelige tekst in zowel alfabetische talen (bijvoorbeeld Engels) als logografische talen (bijvoorbeeld Chinees), waaronder handgeschreven tekst, posters, PowerPoint-dia's en tweetalige inhoud. Het ondersteunt ook consistente beeldbewerkingsoperaties zoals stijloverdracht, toevoegen/verwijderen van objecten en tekstbewerking. Het model kan kleine tekst nauwkeurig weergeven, zoals een alinea op een papier die minder dan een tiende van het beeld inneemt. Qwen-Image is beschikbaar via Qwen Chat en op platforms zoals GitHub, Hugging Face en ModelScope.
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws