Benchmark de 23 Modelos ASR para Ditado de TI em Russo: Minha Recomendação de Março Está Desatualizada
OpenAI
Um desenvolvedor reavaliou modelos de conversão de voz em texto para ditado de TI em russo, testando 23 modelos ASR em mais de 60 configurações com 100.000 execuções. Ele descobriu que o Breeze ASR, uma descoberta inesperada, iguala ou supera o Whisper Large v3, levando a uma recomendação atualizada. O benchmark introduz uma métrica composta Q, que combina WER, precisão de pontuação e um novo Índice de Preservação de Inglês (EPI) para recompensar modelos que mantêm termos em inglês em escrita latina.
Em março, o autor recomendou o Whisper Large v3 para ditado de TI em russo, mas posteriormente descobriu o Breeze ASR, um modelo otimizado para mandarim taiwanês com suporte a code-switching, que teve desempenho pelo menos tão bom. Para verificar, eles construíram um benchmark rigoroso: 23 modelos em mais de 60 configurações, mais de 100.000 execuções em um corpus de TI russo-inglês, usando mais de 120 horas de inferência em uma RTX 5070 Ti. O corpus inclui dois falantes (o autor e sua esposa) lendo textos longos com densidades variadas de termos de TI em inglês. A métrica composta Q (0,65 WER + 0,10 pontuação + 0,25 EPI) equilibra precisão de palavras, qualidade de pontuação e preservação de termos ingleses em escrita latina. O WER é normalizado para não penalizar transliterações, enquanto o EPI recompensa formas canônicas em inglês e dá crédito parcial à retenção imperfeita em latim. Os resultados mostram que o Breeze ASR supera o Whisper Large v3 neste benchmark, tornando a recomendação de março desatualizada. O autor também testou vários prompts de pontuação e descobriu que um prompt personalizado melhora significativamente a pontuação. A página interativa do benchmark permite ajustar os pesos para atender a diferentes cenários de ditado.
Fonte: Habr — хаб ML —
original
