Aplikasi 🇷🇺 08.08.2026 11:02

Masukan Suara ke Jendela Windows Mana Pun dalam Se Detik: Offline, di CPU, Tanpa Satu Gigabyte pun Torch

OpenAIOpenAI
Artikel ini menjelaskan WhisperType, sebuah alat sumber terbuka untuk dikte suara offline di Windows, berdasarkan faster-whisper dan berjalan di CPU. Dijelaskan optimasi kunci: jendela encoder variabel, mematikan cap waktu, pengenalan aliran, dan pemilihan utas otomatis. Hasilnya, waktu respons berkurang dari sekitar 4 detik menjadi sekitar 1 detik untuk frasa pendek.
Penulis mengembangkan WhisperType, sebuah alat dikte gratis dan sumber terbuka (MIT) untuk Windows 10/11 x64. Alat ini memungkinkan input suara ke jendela mana pun melalui hotkey, bekerja offline tanpa hak admin, dan menggunakan model lokal deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32). Masalah utamanya adalah encoder Whisper selalu memproses jendela 30 detik yang tetap, sehingga bahkan frasa pendek membutuhkan sekitar 4 detik pada CPU. Solusinya adalah dengan memonkeypatch fungsi pad_or_trim untuk mempersempit jendela encoder sesuai dengan panjang ucapan sebenarnya. Selain itu, stempel waktu dinonaktifkan saat jendela dipersempit, dan metode berbasis teks digunakan untuk menghapus pengulangan yang jarang terjadi. Untuk dikte panjang, pengenalan aliran (stream) diimplementasikan: audio dipotong pada jeda dan diproses dalam potongan-potongan sementara perekaman berlanjut. Jumlah utas yang optimal dipilih secara otomatis sebagai semua prosesor logis dikurangi dua. Optimasi tambahan: deteksi bahasa eksplisit, aliran audio yang selalu terbuka, model yang dipanaskan terlebih dahulu, impor yang ditunda, dan pemeriksaan untuk keheningan dan kegagalan perangkat audio. Kode tingkat sistem hanya menggunakan ctypes dan WinAPI, menghindari pustaka hook.
Sumber: Habr — хаб ML — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru