ModellerAraştırma 🇷🇺 06.08.2026 07:03

23 ASR Modelinin Rusça BT Diktesi Karşılaştırması: Mart Önerim Artık Geçersiz

OpenAIOpenAI
Bir geliştirici, Rusça BT diktesi için sesli metin modellerini yeniden değerlendirdi; 60'tan fazla yapılandırmada 23 ASR modelini 100.000 çalıştırma ile test etti. Beklenmedik bir bulgu olan Breeze ASR'nin, Whisper Large v3'ü yakaladığını veya aştığını keşfetti ve bu da güncellenmiş bir öneriye yol açtı. Karşılaştırma, WER, noktalama doğruluğu ve İngilizce terimleri Latin alfabesiyle koruyan modelleri ödüllendiren yeni bir İngilizce Koruma Endeksi (EPI) birleştiren bileşik bir Q metriği sunuyor.
Mart ayında yazar, Rusça BT diktesi için Whisper Large v3'ü önermişti, ancak daha sonra Tayvan Mandarin'i için optimize edilmiş ve kod değiştirme desteğine sahip Breeze ASR modelini keşfetti ve bu model en az onun kadar iyi performans gösterdi. Bunu doğrulamak için titiz bir kıyaslama oluşturdular: 60'tan fazla konfigürasyonda 23 model, bir Rusça-İngilizce BT derlemi üzerinde 100.000'den fazla çalıştırma ve bir RTX 5070 Ti üzerinde 120+ saat çıkarım. Derlem, değişen yoğunluklarda İngilizce BT terimleri içeren uzun metinleri okuyan iki konuşmacıyı (yazar ve eşi) içeriyor. Bileşik metrik Q (0,65 WER + 0,10 noktalama + 0,25 EPI), kelime doğruluğunu, noktalama kalitesini ve İngilizce terimlerin Latin alfabesiyle korunmasını dengeler. WER, harf çevirilerini cezalandırmamak için normalleştirilirken, EPI kurallara uygun İngilizce biçimleri ödüllendirir ve kusurlu Latince korumasını kısmen kredilendirir. Sonuçlar, Breeze ASR'ın bu kıyaslamada Whisper Large v3'ten daha iyi performans gösterdiğini ve Mart tavsiyesinin güncelliğini yitirdiğini gösteriyor. Yazar ayrıca birden fazla noktalama istemini test etti ve özel bir istemin noktalama işaretlerini önemli ölçüde iyileştirdiğini buldu. Etkileşimli kıyaslama sayfası, farklı dikte senaryolarına uyacak şekilde ağırlıkların ayarlanmasına olanak tanır.
Kaynak: Habr — хаб ML — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler