Benchmark de 23 modelos ASR para dictado de TI en ruso: mi recomendación de marzo está desactualizada
OpenAI
Un desarrollador re-evaluó los modelos de voz a texto para el dictado de TI en ruso, probando 23 modelos ASR en más de 60 configuraciones con 100,000 ejecuciones. Descubrieron que Breeze ASR, un hallazgo inesperado, iguala o supera a Whisper Large v3, lo que lleva a una recomendación actualizada. El benchmark introduce una métrica compuesta Q, que combina WER, precisión de puntuación y un nuevo Índice de Preservación del Inglés (EPI) para recompensar a los modelos que mantienen términos en inglés en escritura latina.
En marzo, el autor recomendó Whisper Large v3 para la transcripción de dictados en ruso para TI, pero más tarde descubrió Breeze ASR, un modelo optimizado para el mandarín taiwanés con soporte de cambio de código, que funcionaba al menos igual de bien. Para verificarlo, construyó un riguroso punto de referencia: 23 modelos en más de 60 configuraciones, más de 100,000 ejecuciones en un corpus de ruso-inglés para TI, utilizando más de 120 horas de inferencia en una RTX 5070 Ti. El corpus incluye dos hablantes (el autor y su esposa) leyendo textos extensos con distintas densidades de términos de TI en inglés. La métrica compuesta Q (0.65 WER + 0.10 punt + 0.25 EPI) equilibra la precisión de palabras, la calidad de la puntuación y la preservación de los términos en inglés en escritura latina. El WER se normaliza para no penalizar las transliteraciones, mientras que el EPI recompensa las formas canónicas en inglés y acredita parcialmente la retención imperfecta del latín. Los resultados muestran que Breeze ASR supera a Whisper Large v3 en este punto de referencia, lo que hace que la recomendación de marzo esté desactualizada. El autor también probó varias instrucciones de puntuación y descubrió que una instrucción personalizada mejora significativamente la puntuación. La página interactiva del punto de referencia permite ajustar los pesos para adaptarse a diferentes escenarios de dictado.
Fuente: Habr — хаб ML —
original
