AraştırmaMedya Üretimi 🇺🇸 27.07.2026 02:04

Real World VoiceEQ Tanıtıldı: Ses Yapay Zekası Kalitesini Değerlendirmek İçin Yeni Bir Kriter

Hume AIHume AI
Hume AI, insan kalitesinde ses etkileşimini değerlendirmek için Real World VoiceEQ'u piyasaya sürdü. Bir milyondan fazla insan değerlendirmesine dayanan bu kriter, ASR (otomatik konuşma tanıma), TTS (metinden konuşmaya), S2S (konuşmadan konuşmaya) ve konuşma anlama dahil olmak üzere 40'tan fazla modeli 60'tan fazla metrik üzerinden kapsıyor. Kriter, hiçbir modelin tüm kategorilerde mükemmel olmadığını ve mevcut sistemlerin duygu ve bağlam tanımadaki zayıflıklarını ortaya çıkardı.
Hume AI'nın ekibi, ses yapay zekasının kalitesini insan perspektifinden değerlendirmek üzere tasarlanan Real World VoiceEQ benchmark'ını tanıttı. Bu benchmark, otomatik konuşma tanıma (ASR), metinden konuşmaya (TTS), konuşmadan konuşmaya (S2S) ve konuşma anlama alanlarını kapsayan 15'ten fazla temel boyut ve 60'tan fazla metrik üzerinden 40'ın üzerinde önde gelen tescilli ve açık kaynaklı ses yapay zekası modelini değerlendiriyor. Benchmark, farklı demografik gruplar, konuşma tarzları ve akustik ortamlar arasında toplanan 1 milyondan fazla bireysel insan değerlendirmesine dayanıyor. Mevcut sürüm, 785.000 TTS değerlendirmesi ve 48.000 S2S değerlendirmesi içeriyor ve bu da onu ses yapay zekası kalitesi üzerine yapılan en büyük insan döngülü çalışmalardan biri yapıyor. Değerlendirmeler Kairos platformunda gerçekleştirildi. Sonuçlara göre, hiçbir sistem sekiz yetenek grubunun tamamında ilk beşte yer almıyor ve bu da tek bir 'en iyi' ses modeli olmadığını vurguluyor. Konuşmadan konuşmaya modeller en büyük farklılığı gösterdi: Bazıları duyguları tanımada iyi performans gösterirken doğal bir şekilde yanıt veremedi. Sese erişimin, ajanların dil ötesi bilgileri kullanacağını garanti etmediği ortaya çıktı; birçok sistem, tonu, duraklamaları, tereddütleri, tonlamayı ve ses seviyesini göz ardı ederek transkriptlere bağımlı kalmaya devam ediyor. Benchmark ayrıca modellerin aksanlı konuşma, örtüşen sesler, duygular, arka plan gürültüsü ve uzun diyaloglarda daha kötü performans gösterdiğini ortaya koydu. Gürültülü konuşma için kelime hata oranları, müzik arka planına kıyasla yaklaşık dört kat daha yüksekti. Ek olarak, bazı modellerin standart benchmark'lar için optimize edildiği ve referans transkriptlerden bilinen hataları yeniden ürettiği görüldü. Önde gelen konuşma dil modellerinin (SLM'ler), eğitimli insan değerlendiricilerle karşılaştırılması, uyumun net doğru cevapları olan görevlerde en yüksek olduğunu, ancak subjektif değerlendirmelerde azaldığını gösterdi; örneğin, bir sesi bir oyunculuk rolüyle eşleştirme veya kimliği koruma gibi. Otomatik değerlendiriciler, yargı akustik bağlama ve sosyal yoruma bağlı olduğunda henüz insanların yerini alamıyor.
Kaynak: Hugging Face blog — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler