النماذجتوليد الوسائط 🇨🇳 27.07.2026 17:05

علي بابا تطلق Qwen-Image: نموذج MMDiT بـ20 مليار معلمة لتوليد صور دقيقة النص

Alibaba/QwenAlibaba/Qwen
أطلق فريق Qwen من علي بابا نموذج Qwen-Image، وهو نموذج أساسي للصور من نوع MMDiT يضم 20 مليار معلمة، ويتميز بقدرته على عرض النصوص المعقدة بدقة (بما في ذلك النصوص ثنائية اللغة بين الصينية والإنجليزية)، وتحرير الصور بشكل متسق، وأداء قوي عبر معايير مثل GenEval وDPG. يدعم النموذج إنشاء الملصقات، وتوليد الشرائح، وعرض النصوص بدقة في المناطق الصغيرة.
أطلق فريق Qwen من Alibaba نموذج Qwen-Image، وهو نموذج أساسي للصور يعتمد على تقنية MMDiT (Multimodal Diffusion Transformer) ويمتلك 20 مليار معلمة. يحقق النموذج نتائج متطورة على معايير مثل GenEval وDPG وOneIG-Bench للتوليد، وGEdit وImgEdit وGSO للتحرير، وLongText-Bench وChineseWord وTextCraft لعرض النصوص. يتميز النموذج بقدرته على عرض نصوص معقدة متعددة الأسطر في كل من اللغات الأبجدية (مثل الإنجليزية) واللغات اللوغوغرافية (مثل الصينية)، بما في ذلك النصوص المكتوبة بخط اليد، والملصقات، وشرائح العروض التقديمية، والمحتوى ثنائي اللغة. كما يدعم عمليات تحرير الصور المتسقة مثل نقل النمط، وإضافة/حذف الكائنات، وتحرير النص. يمكن للنموذج عرض النصوص الصغيرة بدقة، مثل فقرة على ورقة تشغل أقل من عُشر الصورة. يتوفر Qwen-Image عبر Qwen Chat وعلى منصات مثل GitHub وHugging Face وModelScope.
المصدر: Alibaba Qwen — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة