ModèlesRecherche 🇷🇺 06.08.2026 07:03

Comparatif de 23 modèles de reconnaissance vocale pour la dictée en informatique en russe : ma recommandation de mars est obsolète

OpenAIOpenAI
Un développeur a réévalué les modèles de transcription vocale pour la dictée en informatique en russe, en testant 23 modèles de reconnaissance vocale automatique (ASR) dans plus de 60 configurations avec 100 000 exécutions. Il a découvert que Breeze ASR, un résultat inattendu, égale ou dépasse Whisper Large v3, ce qui conduit à une recommandation mise à jour. Le benchmark introduit une métrique composite Q, combinant le taux d'erreur de mots (WER), la précision de la ponctuation et un nouvel Indice de Préservation de l'Anglais (EPI) pour récompenser les modèles qui conservent les termes anglais en caractères latins.
En mars, l'auteur recommandait Whisper Large v3 pour la dictée informatique en russe, mais a ensuite découvert Breeze ASR, un modèle optimisé pour le mandarin taïwanais avec prise en charge de l'alternance codique, qui performait au moins aussi bien. Pour vérifier cela, il a construit un benchmark rigoureux : 23 modèles dans plus de 60 configurations, plus de 100 000 exécutions sur un corpus informatique russe-anglais, utilisant plus de 120 heures d'inférence sur une RTX 5070 Ti. Le corpus comprend deux locuteurs (l'auteur et sa femme) lisant des textes longs avec des densités variables de termes informatiques anglais. La métrique composite Q (0,65 WER + 0,10 ponctuation + 0,25 EPI) équilibre la précision des mots, la qualité de la ponctuation et la préservation des termes anglais en alphabet latin. Le WER est normalisé pour ne pas pénaliser les translittérations, tandis que l'EPI récompense les formes anglaises canoniques et accorde un crédit partiel pour la rétention imparfaite du latin. Les résultats montrent que Breeze ASR surpasse Whisper Large v3 sur ce benchmark, rendant la recommandation de mars obsolète. L'auteur a également testé plusieurs invites de ponctuation et a constaté qu'une invite personnalisée améliore significativement la ponctuation. La page interactive du benchmark permet d'ajuster les poids pour s'adapter à différents scénarios de dictée.
Source: Habr — хаб ML — original
Nos articles précédents sur ce sujet ↓
Infos fraîches