Entrada de voz en cualquier ventana de Windows en un segundo: sin conexión, en CPU y sin un solo gigabyte de Torch
OpenAI
El artículo describe WhisperType, una herramienta de código abierto para dictado por voz sin conexión en Windows, basada en faster-whisper y que se ejecuta en CPU. Explica optimizaciones clave: ventana de codificador variable, desactivación de marcas de tiempo, reconocimiento en streaming y selección automática de hilos. Como resultado, el tiempo de respuesta se reduce de aproximadamente 4 segundos a aproximadamente 1 segundo para frases cortas.
El autor desarrolló WhisperType, una herramienta de dictado gratuita y de código abierto (MIT) para Windows 10/11 x64. Permite la entrada de voz en cualquier ventana mediante una tecla de acceso rápido, funciona sin conexión y sin derechos de administrador, y utiliza un modelo local deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32). El problema principal es que el codificador Whisper siempre procesa una ventana fija de 30 segundos, por lo que incluso una frase corta tarda unos 4 segundos en CPU. La solución es modificar mediante monkeypatch la función pad_or_trim para reducir la ventana del codificador según la duración real del habla. Además, se deshabilitan las marcas de tiempo al reducir la ventana y se utiliza un método basado en texto para eliminar repeticiones raras. Para dictados largos, se implementa el reconocimiento en streaming: el audio se corta en las pausas y se procesa en fragmentos mientras la grabación continúa. El número óptimo de hilos se selecciona automáticamente como todos los procesadores lógicos menos dos. Optimizaciones adicionales: detección explícita de idioma, flujo de audio siempre abierto, modelo precalentado, importaciones diferidas y comprobaciones de silencio y fallos del dispositivo de audio. El código a nivel de sistema utiliza solo ctypes y WinAPI, evitando librerías de ganchos.
Fuente: Habr — хаб ML —
original
