Toepassingen 🇷🇺 08.08.2026 11:02

Spraakinvoer in elk Windows-venster binnen een seconde: offline, op CPU, zonder één gigabyte aan Torch

OpenAIOpenAI
Het artikel beschrijft WhisperType, een open-source tool voor offline spraakdictatie in Windows, gebaseerd op faster-whisper en draaiend op de CPU. Het legt de belangrijkste optimalisaties uit: variabel encoder-venster, uitschakelen van tijdstempels, streamingherkenning en automatische threadselectie. Als resultaat daalt de responstijd van ongeveer 4 seconden naar ongeveer 1 seconde voor korte zinnen.
De auteur ontwikkelde WhisperType, een gratis en open-source (MIT) dicteertool voor Windows 10/11 x64. Het maakt spraakinvoer mogelijk in elk venster via een sneltoets, werkt offline zonder beheerdersrechten en gebruikt een lokaal model deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32). Het belangrijkste probleem is dat de Whisper-encoder altijd een vast venster van 30 seconden verwerkt, waardoor zelfs een korte zin ongeveer 4 seconden op de CPU kost. De oplossing is om de functie pad_or_trim te monkeypatchen om het encoder-venster te verkleinen op basis van de werkelijke spraakduur. Ook worden tijdsstempels uitgeschakeld wanneer het venster wordt verkleind, en wordt een op tekst gebaseerde methode gebruikt om zeldzame herhalingen te verwijderen. Voor lange dicteersessies is streamherkenning geïmplementeerd: audio wordt geknipt bij pauzes en in stukken verwerkt terwijl de opname doorgaat. Het optimale aantal threads wordt automatisch gekozen als alle logische processors minus twee. Extra optimalisaties: expliciete taaldetectie, altijd-open audiostream, voorverwarmd model, uitgestelde imports en controles op stilte en audiodevicefouten. De systeemcode gebruikt alleen ctypes en WinAPI, zonder hooks-bibliotheken.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws