मॉडलओपन सोर्स 🇨🇳 28.07.2026 19:03

Alibaba ने जारी किया Qwen2-Audio: वॉयस चैट और विश्लेषण के साथ नया ऑडियो-भाषा मॉडल

Alibaba/QwenAlibaba/Qwen
Alibaba ने Qwen2-Audio पेश किया — ऑडियो-भाषा मॉडल का नया संस्करण, जो बिना ऑटोमैटिक स्पीच रिकॉग्निशन (ASR) के वॉयस चैट, ध्वनियों, संगीत और वाणी का विश्लेषण, और 8 से अधिक भाषाओं को सपोर्ट करता है। Qwen2-Audio-7B और Qwen2-Audio-7B-Instruct मॉडल Hugging Face और ModelScope पर खुले हैं। प्रदर्शन कई बेंचमार्क पर पिछले स्टेट-ऑफ-द-आर्ट (SOTA) से बेहतर है।
Alibaba ने Qwen-Audio का अगला संस्करण Qwen2-Audio जारी किया है, जो ऑडियो और टेक्स्ट इनपुट लेने तथा टेक्स्ट आउटपुट देने में सक्षम है। पहली बार उपयोगकर्ता बिना एएसआर (ASR - स्वचालित वाक् पहचान) मॉड्यूल के वॉयस कमांड दे सकते हैं। यह मॉडल टेक्स्ट निर्देशों के आधार पर ऑडियो जानकारी (भाषण, ध्वनियाँ, संगीत) का विश्लेषण कर सकता है और चीनी, अंग्रेजी, कैंटोनीज़, फ्रेंच, इतालवी, स्पेनिश, जर्मन और जापानी सहित 8 से अधिक भाषाओं का समर्थन करता है। Qwen2-Audio-7B और Qwen2-Audio-7B-Instruct मॉडल के वेट Hugging Face और ModelScope पर ओपन-सोर्स हैं। LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound और AIR-Benchmark जैसे बेंचमार्क में Qwen2-Audio पिछले एसओटीए (SOTA - स्टेट-ऑफ-द-आर्ट) और Qwen-Audio से काफी बेहतर प्रदर्शन करता है। इसकी आर्किटेक्चर भाषा मॉडल Qwen और ऑडियो एनकोडर पर आधारित है, और प्रशिक्षण में मल्टी-टास्क प्रीट्रेनिंग, सुपरवाइज्ड फाइन-ट्यूनिंग और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन शामिल है। भविष्य में बड़े डेटासेट पर प्रशिक्षण, 30 सेकंड से अधिक लंबे ऑडियो के लिए समर्थन और बड़े मॉडलों की योजना है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार