⚡ عاجل
النماذجتوليد الوسائط 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: يرى ويسمع ويتحدث ويكتب – كل ذلك في نموذج واحد

Alibaba/QwenAlibaba/Qwen
أصدرت Alibaba Qwen نموذج Qwen2.5-Omni الرائد متعدد الوسائط، القادر على معالجة النصوص والصور والصوت والفيديو، بالإضافة إلى توليد الكلام في الوقت الفعلي. يستخدم النموذج بنية Thinker-Talker ويتفوق على النماذج المماثلة في جميع الوسائط.
أعلنت Alibaba Qwen عن إطلاق Qwen2.5-Omni، وهو نموذج رئيسي جديد في سلسلة Qwen مصمم للإدراك متعدد الوسائط الشامل. يعالج النموذج النصوص والصور والصوت والفيديو، ويولد استجابات متدفقة على شكل نصوص أو كلام طبيعي. تتضمن بنية المفكر-المتحدث (Thinker-Talker) مفكرًا يفهم المدخلات ومتحدثًا يولد الكلام. يتوفر النموذج على منصات Hugging Face وModelScope وDashScope وGitHub. يتفوق Qwen2.5-Omni على Qwen2.5-VL-7B وQwen2-Audio في مهام الصوت، ويضاهيهما في الفيديو والصور، ويحقق نتائج متطورة على معيار OmniBench. كما يظهر النموذج دقة عالية في التعرف على الكلام والترجمة وفهم الصوت وتوليد الكلام. تشمل الخطط المستقبلية تحسين الامتثال للأوامر الصوتية ودمج المزيد من الوسائط.
المصدر: Alibaba Qwen — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة