Alibaba ने जारी किया Qwen2-Audio: वॉयस चैट और विश्लेषण वाला नया ऑडियो-भाषा मॉडल
Alibaba/Qwen
Alibaba ने Qwen2-Audio पेश किया - ऑडियो-भाषा मॉडल का नया संस्करण जो बिना ASR के वॉयस चैट, ध्वनियों, संगीत और भाषण का विश्लेषण, और 8 से अधिक भाषाओं का समर्थन करता है। Qwen2-Audio-7B और Qwen2-Audio-7B-Instruct मॉडल Hugging Face और ModelScope पर खुले हैं। प्रदर्शन कई बेंचमार्क पर पिछले SOTA से बेहतर है।
Alibaba ने Qwen-Audio का अगला संस्करण Qwen2-Audio जारी किया है, जो ऑडियो और टेक्स्ट इनपुट लेने तथा टेक्स्ट आउटपुट देने में सक्षम है। पहली बार उपयोगकर्ता बिना एएसआर (ASR - स्वचालित वाक् पहचान) मॉड्यूल के वॉयस कमांड दे सकते हैं। यह मॉडल टेक्स्ट निर्देशों के आधार पर ऑडियो जानकारी (भाषण, ध्वनियाँ, संगीत) का विश्लेषण कर सकता है और चीनी, अंग्रेजी, कैंटोनीज़, फ्रेंच, इतालवी, स्पेनिश, जर्मन और जापानी सहित 8 से अधिक भाषाओं का समर्थन करता है। Qwen2-Audio-7B और Qwen2-Audio-7B-Instruct मॉडल के वेट Hugging Face और ModelScope पर ओपन-सोर्स हैं। LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound और AIR-Benchmark जैसे बेंचमार्क में Qwen2-Audio पिछले एसओटीए (SOTA - स्टेट-ऑफ-द-आर्ट) और Qwen-Audio से काफी बेहतर प्रदर्शन करता है। इसकी आर्किटेक्चर भाषा मॉडल Qwen और ऑडियो एनकोडर पर आधारित है, और प्रशिक्षण में मल्टी-टास्क प्रीट्रेनिंग, सुपरवाइज्ड फाइन-ट्यूनिंग और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन शामिल है। भविष्य में बड़े डेटासेट पर प्रशिक्षण, 30 सेकंड से अधिक लंबे ऑडियो के लिए समर्थन और बड़े मॉडलों की योजना है।
स्रोत: Alibaba Qwen —
मूल
