अनुप्रयोग 🇷🇺 08.08.2026 11:02

किसी भी विंडोज़ विंडो में एक सेकंड में वॉयस इनपुट: ऑफलाइन, सीपीयू पर, बिना एक भी गीगाबाइट टॉर्च के

OpenAIOpenAI
यह लेख WhisperType का वर्णन करता है, जो विंडोज़ के लिए एक ओपन-सोर्स ऑफलाइन वॉयस डिक्टेशन टूल है, जो faster-whisper पर आधारित है और सीपीयू पर चलता है। यह मुख्य अनुकूलन बताता है: परिवर्तनीय एनकोडर विंडो, टाइमस्टैम्प बंद करना, स्ट्रीम पहचान, और ऑटो थ्रेड चयन। परिणामस्वरूप, छोटे वाक्यांशों के लिए प्रतिक्रिया समय लगभग 4 सेकंड से घटकर लगभग 1 सेकंड रह जाता है।
लेखक ने WhisperType विकसित किया है, जो Windows 10/11 x64 के लिए एक मुफ्त और ओपन-सोर्स (MIT) डिक्टेशन टूल है। यह हॉटकी के माध्यम से किसी भी विंडो में वॉयस इनपुट की अनुमति देता है, बिना इंटरनेट के ऑफ़लाइन काम करता है और एडमिन अधिकारों की आवश्यकता नहीं होती। यह एक स्थानीय मॉडल deepdml/faster-whisper-large-v3-turbo-ct2 (CTranslate2, int8_float32) का उपयोग करता है। मुख्य समस्या यह है कि Whisper का एन्कोडर हमेशा एक निश्चित 30-सेकंड की विंडो प्रोसेस करता है, इसलिए CPU पर एक छोटा वाक्यांश भी लगभग 4 सेकंड लेता है। समाधान pad_or_trim फ़ंक्शन को मंकीपैच करना है ताकि वास्तविक भाषण की लंबाई के अनुसार एन्कोडर विंडो को संकुचित किया जा सके। साथ ही, जब विंडो संकुचित होती है तो टाइमस्टैम्प अक्षम कर दिए जाते हैं, और दुर्लभ दोहराव को हटाने के लिए एक टेक्स्ट-आधारित विधि का उपयोग किया जाता है। लंबे डिक्टेशन के लिए, स्ट्रीम पहचान लागू की गई है: ऑडियो को विराम पर काटा जाता है और रिकॉर्डिंग जारी रहने के दौरान टुकड़ों में प्रोसेस किया जाता है। इष्टतम थ्रेड की संख्या स्वचालित रूप से सभी लॉजिकल प्रोसेसर माइनस दो के रूप में चुनी जाती है। अतिरिक्त अनुकूलन: स्पष्ट भाषा पहचान, हमेशा-खुला ऑडियो स्ट्रीम, प्री-वार्म्ड मॉडल, विलंबित इम्पोर्ट, और साइलेंस तथा ऑडियो डिवाइस विफलता की जाँच। सिस्टम-स्तरीय कोड केवल ctypes और WinAPI का उपयोग करता है, जिससे हुक लाइब्रेरी से बचा जाता है।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार