ModellerAçık Kaynak 🇨🇳 28.07.2026 19:03

Alibaba Qwen2-Audio'yu Yayınladı: Sesli Sohbet ve Analiz Sunan Yeni Bir Ses-Dil Modeli

Alibaba/QwenAlibaba/Qwen
Alibaba, ASR olmadan sesli sohbet, ses, müzik ve konuşma analizi ile 8'den fazla dili destekleyen yeni bir ses-dil modeli olan Qwen2-Audio'yu tanıttı. Qwen2-Audio-7B ve Qwen2-Audio-7B-Instruct modelleri Hugging Face ve ModelScope'da açık kaynak olarak yayınlandı. Performans, çeşitli kıyaslamalarda önceki en iyi sonuçları geride bırakıyor.
Alibaba, Qwen-Audio'nun bir sonraki sürümü olan Qwen2-Audio'yu yayınladı. Bu model, ses ve metin girdilerini kabul edip metin çıktısı üretebiliyor. İlk kez kullanıcılar, herhangi bir Otomatik Konuşma Tanıma modülüne ihtiyaç duymadan sesli komutlar verebiliyor. Model, metin talimatlarına göre ses bilgilerini (konuşma, sesler, müzik) analiz edebiliyor ve Çince, İngilizce, Kantonca, Fransızca, İtalyanca, İspanyolca, Almanca ve Japonca dahil olmak üzere 8'den fazla dili destekliyor. Qwen2-Audio-7B ve Qwen2-Audio-7B-Instruct modellerinin ağırlıkları Hugging Face ve ModelScope'da açık kaynak olarak sunuldu. LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound ve AIR-Benchmark kıyaslamalarında Qwen2-Audio, önceki en iyi modelleri ve Qwen-Audio'yu önemli ölçüde geride bırakıyor. Mimarisi, Qwen dil modeli ve bir ses kodlayıcıya dayanıyor; eğitim, çok görevli ön eğitim, denetimli ince ayar ve doğrudan tercih optimizasyonunu içeriyor. Gelecekte daha büyük veri kümeleri üzerinde eğitim, 30 saniyeden uzun ses desteği ve daha büyük modeller planlanıyor.
Kaynak: Alibaba Qwen — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler