Alibaba تطلق Qwen2-Audio: نموذج لغة صوتي جديد مع دردشة صوتية وتحليل
Alibaba/Qwen
أعلنت Alibaba عن إطلاق Qwen2-Audio، النسخة الجديدة من نموذج اللغة الصوتي الذي يدعم الدردشة الصوتية دون التعرف التلقائي على الكلام (ASR)، وتحليل الأصوات والموسيقى والكلام، بالإضافة إلى أكثر من 8 لغات. النماذج Qwen2-Audio-7B وQwen2-Audio-7B-Instruct متاحة مفتوحة المصدر على Hugging Face وModelScope. الأداء يتفوق على النماذج السابقة الأحدث (SOTA) في عدة اختبارات مرجعية.
أعلنت شركة Alibaba عن إطلاق Qwen2-Audio، الإصدار التالي من Qwen-Audio، القادر على استقبال مدخلات صوتية ونصية وتوليد نصوص. لأول مرة، يمكن للمستخدمين إعطاء أوامر صوتية دون وحدات التعرف التلقائي على الكلام (Automatic Speech Recognition - ASR). النموذج قادر على تحليل المعلومات الصوتية (الكلام والأصوات والموسيقى) وفقًا لتعليمات نصية، ويدعم أكثر من 8 لغات، بما في ذلك الصينية والإنجليزية والكانتونية والفرنسية والإيطالية والإسبانية والألمانية واليابانية. أوزان النموذجين Qwen2-Audio-7B و Qwen2-Audio-7B-Instruct متاحة مفتوحة المصدر على منصتي Hugging Face و ModelScope. في معايير الأداء مثل LibriSpeech و Common Voice 15 و Fleurs و Aishell2 و CoVoST2 و Meld و Vocalsound و AIR-Benchmark، يتفوق Qwen2-Audio بشكل كبير على النماذج السابقة المتطورة (State-of-the-Art - SOTA) و Qwen-Audio. تعتمد البنية على نموذج اللغة Qwen ومشفّر صوتي، ويشمل التدريب التدريب المسبق متعدد المهام (multitask pretraining) والضبط الدقيق الخاضع للإشراف (supervised fine-tuning) وتحسين التفضيل المباشر (direct preference optimization - DPO). في المستقبل، يُخطط للتدريب على مجموعات بيانات أكبر، ودعم صوتيات أطول من 30 ثانية، ونماذج أكبر حجمًا.
المصدر: Alibaba Qwen —
الأصلي
