Sovellukset 🇷🇺 08.08.2026 11:02

Äänisyöttö mihin tahansa Windows-ikkunaan sekunnissa: offline, suorittimella, ilman yhtäkään gigatavua Torchia

OpenAIOpenAI
Artikkelissa kuvataan WhisperType, avoimen lähdekoodin työkalu offline-äänisaneluun Windowsissa, joka perustuu faster-whisperiin ja toimii suorittimella. Siinä selitetään keskeiset optimoinnit: muuttuva encoder-ikkuna, aikaleimojen poistaminen käytöstä, stream-tunnistus ja automaattinen säikeiden valinta. Tämän seurauksena vasteaika lyhenee lyhyissä lauseissa noin 4 sekunnista noin 1 sekuntiin.
Kirjoittaja kehitti WhisperType-nimisen ilmaisen ja avoimen lähdekoodin (MIT) sanelutyökalun Windows 10/11 x64 -järjestelmille. Se mahdollistaa äänisyötteen mihin tahansa ikkunaan pikanäppäimellä, toimii offline-tilassa ilman järjestelmänvalvojan oikeuksia ja käyttää paikallista deepdml/faster-whisper-large-v3-turbo-ct2-mallia (CTranslate2, int8_float32). Pääongelmana on, että Whisper-kooderi käsittelee aina kiinteän 30 sekunnin ikkunan, joten jopa lyhyt lause kestää noin 4 sekuntia suorittimella. Ratkaisuna on korjata pad_or_trim-funktio niin, että kooderin ikkuna kavennetaan todellisen puheen pituuden mukaan. Lisäksi aikaleimat poistetaan käytöstä, kun ikkunaa kavennetaan, ja harvinaisten toistojen poistamiseen käytetään tekstipohjaista menetelmää. Pitkissä saneluissa on toteutettu stream-tunnistus: ääni katkaistaan taukojen kohdalta ja käsitellään paloissa tallennuksen jatkuessa. Optimaalinen säikeiden määrä valitaan automaattisesti niin, että se on kaikkien loogisten suorittimien määrä miinus kaksi. Muita optimointeja ovat eksplisiittinen kielentunnistus, aina avoinna oleva äänivirta, esilämmitetty malli, viivästetyt tuonnit sekä tarkistukset hiljaisuuden ja äänilaitteen vikojen varalta. Järjestelmätason koodi käyttää vain ctypes- ja WinAPI-rajapintoja, välttäen hook-kirjastoja.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset