⚡ SON DAKİKA
ModellerMedya Üretimi 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Görür, Duyar, Konuşur, Yazar – Hepsi Bir Arada

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen, metin, görüntü, ses ve videoyu işleyebilen ve gerçek zamanlı konuşma üretebilen amiral gemisi çok modlu modeli Qwen2.5-Omni'yi yayınladı. Model, Thinker-Talker mimarisini kullanıyor ve tüm modalitelerde benzer modelleri geride bırakıyor.
Alibaba Qwen, Qwen serisinin kapsamlı çok modlu algılama için tasarlanmış yeni amiral gemisi modeli Qwen2.5-Omni'yi tanıttı. Model metin, görüntü, ses ve videoyu işleyerek metin veya doğal konuşma biçiminde akış yanıtları üretiyor. Thinker-Talker mimarisi, girdiyi anlayan bir Thinker (Düşünür) ve konuşma üreten bir Talker (Konuşmacı) içeriyor. Model Hugging Face, ModelScope, DashScope ve GitHub'da mevcut. Qwen2.5-Omni, ses görevlerinde Qwen2.5-VL-7B ve Qwen2-Audio'dan daha iyi performans gösteriyor, video ve görüntülerde karşılaştırılabilir düzeyde ve OmniBench'te son teknoloji sonuçlara ulaşıyor. Model ayrıca konuşma tanıma, çeviri, ses anlama ve konuşma üretiminde yüksek doğruluk sergiliyor. Gelecek planları arasında sesli komutlara uyumun iyileştirilmesi ve daha fazla modalitenin entegre edilmesi yer alıyor.
Kaynak: Alibaba Qwen — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler