Anwendungen 🇷🇺 08.08.2026 11:02

Spracheingabe in jedes Windows-Fenster in Sekundenschnelle: offline, auf der CPU, ohne ein einziges Gigabyte Torch

OpenAIOpenAI
Der Artikel beschreibt WhisperType, ein Open-Source-Tool für Offline-Sprachdiktat in Windows, basierend auf faster-whisper und laufend auf der CPU. Es erklärt die wichtigsten Optimierungen: variables Encoder-Fenster, Deaktivierung von Zeitstempeln, Streaming-Erkennung und automatische Thread-Auswahl. Dadurch reduziert sich die Reaktionszeit für kurze Phrasen von etwa 4 Sekunden auf etwa 1 Sekunde.
Der Autor entwickelte WhisperType, ein kostenloses Open-Source-Diktierwerkzeug (MIT-Lizenz) für Windows 10/11 x64. Es ermöglicht die Spracheingabe in jedes Fenster per Hotkey, funktioniert offline ohne Administratorrechte und verwendet ein lokales Modell deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32). Das Hauptproblem besteht darin, dass der Whisper-Encoder immer ein festes 30-Sekunden-Fenster verarbeitet, sodass selbst eine kurze Phrase auf der CPU etwa 4 Sekunden dauert. Die Lösung besteht darin, die Funktion pad_or_trim zu monkeypatchen, um das Encoder-Fenster entsprechend der tatsächlichen Sprachlänge zu verengen. Außerdem werden Zeitstempel deaktiviert, wenn das Fenster verengt wird, und eine textbasierte Methode zum Entfernen seltener Wiederholungen verwendet. Für lange Diktate wird eine Stream-Erkennung implementiert: Das Audio wird an Pausen geschnitten und in Blöcken verarbeitet, während die Aufnahme fortgesetzt wird. Die optimale Anzahl von Threads wird automatisch als alle logischen Prozessoren minus zwei ausgewählt. Zusätzliche Optimierungen: explizite Spracherkennung, immer geöffneter Audiostream, vorgewärmtes Modell, verzögerte Importe sowie Prüfungen auf Stille und Audiogerätefehler. Der systemnahe Code verwendet nur ctypes und WinAPI und vermeidet Hook-Bibliotheken.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten