Qwen2.5 Omni: देखता, सुनता, बोलता, लिखता है — सब एक में
Alibaba/Qwen
Alibaba Qwen ने Qwen2.5-Omni जारी किया है, जो एक नया फ्लैगशिप मल्टीमॉडल मॉडल है जो टेक्स्ट, इमेज, ऑडियो और वीडियो को प्रोसेस करने के साथ-साथ वास्तविक समय में टेक्स्ट और प्राकृतिक भाषण में प्रतिक्रिया उत्पन्न करने में सक्षम है। यह मॉडल, जो Thinker-Talker आर्किटेक्चर पर बनाया गया है, ओपन-सोर्स है और सभी मोडैलिटीज में उच्च प्रदर्शन प्रदर्शित करता है।
अलीबाबा Qwen ने Qwen2.5-Omni जारी किया है — एक एंड-टू-एंड मल्टीमॉडल मॉडल जो टेक्स्ट, इमेज, ऑडियो और वीडियो को समझता है और साथ ही टेक्स्ट तथा प्राकृतिक भाषण को स्ट्रीमिंग मोड में उत्पन्न करता है। मॉडल के केंद्र में एक नई आर्किटेक्चर Thinker-Talker है, जहाँ Thinker (मस्तिष्क के समान) विभिन्न मोडैलिटी के इनपुट को प्रोसेस करता है और उच्च-स्तरीय प्रस्तुतियाँ बनाता है, जबकि Talker (मुँह के समान) उनके आधार पर भाषण टोकन उत्पन्न करता है। साथ ही, एक नई पोजीशनल एम्बेडिंग TMRoPE (Time-aligned Multimodal RoPE) प्रस्तावित की गई है, जो वीडियो और ऑडियो के टाइमस्टैम्प को सिंक्रोनाइज़ करती है। Qwen2.5-Omni पूरी तरह से रियल-टाइम को सपोर्ट करता है, जिसमें चंक्ड इनपुट और तत्काल आउटपुट शामिल है। भाषण उत्पादन की गुणवत्ता में, मॉडल कई मौजूदा स्ट्रीमिंग और नॉन-स्ट्रीमिंग विकल्पों से बेहतर प्रदर्शन करता है। बेंचमार्क में, Qwen2.5-Omni दृष्टि के मामले में Qwen2.5-VL-7B के बराबर परिणाम दिखाता है, ऑडियो में Qwen2-Audio से बेहतर है, और मोडैलिटी इंटीग्रेशन कार्यों (OmniBench) में अत्याधुनिक स्तर प्राप्त करता है। मॉडल Hugging Face, ModelScope, DashScope और GitHub पर, साथ ही Qwen Chat और डेमो वर्जन के माध्यम से उपलब्ध है।
स्रोत: Alibaba Qwen —
मूल
