Entrada de Voz em Qualquer Janela do Windows em um Segundo: Offline, na CPU, sem um Único Gigabyte de Torch
OpenAI
O artigo descreve o WhisperType, uma ferramenta de código aberto para ditado de voz offline no Windows, baseada em faster-whisper e rodando na CPU. Explica as principais otimizações: janela de codificador variável, desativação dos carimbos de tempo, reconhecimento em fluxo e seleção automática de threads. Como resultado, o tempo de resposta reduz de aproximadamente 4 segundos para cerca de 1 segundo para frases curtas.
O autor desenvolveu o WhisperType, uma ferramenta de ditado gratuita e de código aberto (MIT) para Windows 10/11 x64. Ela permite entrada de voz em qualquer janela por meio de tecla de atalho, funciona offline sem direitos de administrador e usa o modelo local deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32). O principal problema é que o encoder do Whisper sempre processa uma janela fixa de 30 segundos, então mesmo uma frase curta leva cerca de 4 segundos na CPU. A solução é aplicar um patch na função pad_or_trim para reduzir a janela do encoder de acordo com o comprimento real da fala. Além disso, os timestamps são desabilitados quando a janela é reduzida, e um método baseado em texto é usado para remover repetições raras. Para ditados longos, a reconhecimento em fluxo é implementado: o áudio é cortado em pausas e processado em partes enquanto a gravação continua. O número ideal de threads é selecionado automaticamente como todos os processadores lógicos menos dois. Otimizações adicionais: detecção explícita de idioma, fluxo de áudio sempre aberto, modelo pré-aquecido, importações adiadas e verificações de silêncio e falhas no dispositivo de áudio. O código de nível de sistema usa apenas ctypes e WinAPI, evitando bibliotecas de ganchos.
Fonte: Habr — хаб ML —
original
