Qwen VLo: نموذج متعدد الوسائط موحد للفهم والتوليد من Alibaba
Alibaba/Qwen
تطلق Alibaba نموذج Qwen VLo، وهو نموذج متعدد الوسائط موحد يفهم الصور ويولدها. يدعم التحرير المفتوح، والتعليمات متعددة اللغات، والدقة الديناميكية، والتوليد التدريجي من الأعلى إلى الأسفل ومن اليسار إلى اليمين. متوفر كمعاينة على Qwen Chat.
تقدم Alibaba نموذج Qwen VLo، وهو نموذج متعدد الوسائط موحد جديد يمكنه فهم الصور وتوليدها. يمثل هذا النموذج ترقية عن سلسلة QwenVL السابقة، حيث يربط بين الإدراك والإبداع. يستخدم طريقة توليد تدريجية، حيث يُنشئ الصور تدريجيًا من اليسار إلى اليمين ومن الأعلى إلى الأسفل. يدعم Qwen VLo فهم المحتوى الدقيق، والتحرير القائم على التعليمات المفتوحة (نقل النمط، تعديل الكائنات، تغيير الخلفية)، والتعليمات متعددة اللغات (الصينية والإنجليزية)، والدقة الديناميكية مع نسب أبعاد عشوائية. يمكنه أيضًا أداء مهام الإدراك البصري مثل التنبؤ بخريطة العمق، والتجزئة، واكتشاف الحواف عبر أوامر التحرير. النموذج حاليًا في مرحلة المعاينة ومتاح عبر Qwen Chat. تشمل القيود عدم الدقة والتناقضات العرضية.
المصدر: Alibaba Qwen —
الأصلي
