⚡ BREAKING

Qwen2.5 Omni: देखता, सुनता, बोलता और लिखता है – सब एक में

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ने Qwen2.5-Omni जारी किया है, जो एक प्रमुख मल्टीमॉडल मॉडल है जो टेक्स्ट, इमेज, ऑडियो और वीडियो प्रोसेस कर सकता है, साथ ही रीयल-टाइम स्पीच जनरेट कर सकता है। यह मॉडल Thinker-Talker आर्किटेक्चर का उपयोग करता है और सभी मोडैलिटीज़ में समान मॉडलों से बेहतर प्रदर्शन करता है।
Alibaba Qwen ने Qwen2.5-Omni को पेश किया है, जो Qwen श्रृंखला का एक नया प्रमुख मॉडल है जिसे व्यापक मल्टीमॉडल धारणा के लिए डिज़ाइन किया गया है। यह मॉडल टेक्स्ट, इमेज, ऑडियो और वीडियो को प्रोसेस करता है, और टेक्स्ट या प्राकृतिक भाषण के रूप में स्ट्रीमिंग प्रतिक्रियाएँ उत्पन्न करता है। Thinker-Talker आर्किटेक्चर में एक Thinker शामिल है जो इनपुट को समझता है और एक Talker जो भाषण उत्पन्न करता है। यह मॉडल Hugging Face, ModelScope, DashScope और GitHub पर उपलब्ध है। Qwen2.5-Omni ऑडियो कार्यों में Qwen2.5-VL-7B और Qwen2-Audio से बेहतर प्रदर्शन करता है, वीडियो और इमेज पर तुलनीय है, और OmniBench पर नवीनतम परिणाम प्राप्त करता है। मॉडल वाक् पहचान, अनुवाद, ऑडियो समझ और वाक् उत्पादन में उच्च सटीकता भी प्रदर्शित करता है। भविष्य की योजनाओं में वॉयस कमांड्स के पालन में सुधार और अधिक मोडैलिटीज़ को एकीकृत करना शामिल है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार