Ứng dụng 🇷🇺 08.08.2026 11:02

Nhập giọng nói vào bất kỳ cửa sổ Windows nào chỉ trong một giây: hoạt động ngoại tuyến, trên CPU, không cần một gigabyte Torch nào

OpenAIOpenAI
Bài viết mô tả WhisperType, một công cụ mã nguồn mở để nhập liệu bằng giọng nói ngoại tuyến trong Windows, dựa trên faster-whisper và chạy trên CPU. Bài viết giải thích các tối ưu hóa chính: cửa sổ encoder biến thiên, tắt timestamps, nhận dạng luồng, và tự động chọn luồng xử lý. Kết quả là, thời gian phản hồi giảm từ khoảng 4 giây xuống còn khoảng 1 giây cho các cụm từ ngắn.
Tác giả đã phát triển WhisperType, một công cụ đọc chính tả miễn phí và mã nguồn mở (MIT) dành cho Windows 10/11 x64. Nó cho phép nhập liệu bằng giọng nói vào bất kỳ cửa sổ nào thông qua phím tắt, hoạt động ngoại tuyến mà không cần quyền quản trị viên, và sử dụng mô hình cục bộ deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32). Vấn đề chính là bộ mã hóa Whisper luôn xử lý một cửa sổ cố định 30 giây, vì vậy ngay cả một cụm từ ngắn cũng mất khoảng 4 giây trên CPU. Giải pháp là sửa bản vá cho hàm pad_or_trim để thu hẹp cửa sổ mã hóa theo độ dài thực tế của giọng nói. Ngoài ra, dấu thời gian bị vô hiệu hóa khi cửa sổ bị thu hẹp, và một phương pháp dựa trên văn bản được sử dụng để loại bỏ các lặp lại hiếm gặp. Đối với các bài đọc chính tả dài, nhận dạng luồng được triển khai: âm thanh được cắt ở các khoảng dừng và xử lý theo từng khối trong khi vẫn tiếp tục ghi âm. Số luồng tối ưu được tự động chọn là tất cả các bộ xử lý logic trừ đi hai. Các tối ưu hóa bổ sung: phát hiện ngôn ngữ rõ ràng, luồng âm thanh luôn mở, mô hình được làm nóng trước, nhập trễ, và kiểm tra độ im lặng cũng như lỗi thiết bị âm thanh. Mã cấp hệ thống chỉ sử dụng ctypes và WinAPI, tránh các thư viện hook.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới