애플리케이션 🇷🇺 08.08.2026 11:02

1초 만에 윈도우 창 어디에나 음성 입력: 오프라인, CPU로, 토치 1기가도 없이

OpenAIOpenAI
이 기사는 faster-whisper 기반으로 CPU에서 실행되는 오프라인 음성 받아쓰기 도구인 WhisperType에 대해 설명합니다. 핵심 최적화로는 가변 인코더 창, 타임스탬프 끄기, 스트림 인식, 자동 스레드 선택이 있습니다. 그 결과, 짧은 구절의 응답 시간이 약 4초에서 약 1초로 단축되었습니다.
저자는 Windows 10/11 x64용 무료 오픈소스(MIT) 받아쓰기 도구인 WhisperType을 개발했습니다. 이 도구는 단축키를 통해 모든 창에서 음성 입력을 가능하게 하며, 오프라인으로 작동하고 관리자 권한이 필요 없습니다. 로컬 모델 deepdml/faster-whisper-large-v3-turbo-ct2(CTranslate2, int8_float32)을 사용합니다. 주요 문제는 Whisper 인코더가 항상 고정된 30초 창을 처리하기 때문에, 짧은 구절도 CPU에서 약 4초가 걸린다는 점입니다. 해결책은 pad_or_trim 함수를 모니터 패치하여 실제 음성 길이에 따라 인코더 창을 좁히는 것입니다. 또한 창을 좁힐 때는 타임스탬프가 비활성화되며, 드문 반복을 제거하는 텍스트 기반 방법을 사용합니다. 긴 받아쓰기의 경우 스트림 인식이 구현되어 있습니다. 오디오가 일시 중지되는 지점에서 잘라내어 녹음이 계속되는 동안 청크 단위로 처리합니다. 최적의 스레드 수는 전체 논리 프로세서에서 2를 뺀 값으로 자동 선택됩니다. 추가 최적화로는 명시적 언어 감지, 항상 열린 오디오 스트림, 사전 워밍된 모델, 지연된 임포트, 침묵 및 오디오 장치 오류 검사가 있습니다. 시스템 수준 코드는 후킹 라이브러리를 피하고 ctypes와 WinAPI만 사용합니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스