إدخال صوتي في أي نافذة ويندوز خلال ثانية: دون اتصال، على المعالج، بدون غيغابايت واحد من Torch
OpenAI
تصف المقالة أداة WhisperType، وهي أداة مفتوحة المصدر للإملاء الصوتي دون اتصال في ويندوز، مبنية على faster-whisper وتعمل على المعالج المركزي. تشرح التحسينات الرئيسية: نافذة ترميز متغيرة، إيقاف تشغيل الطوابع الزمنية، التعرف على التدفق، والاختيار التلقائي لعدد الخيوط. ونتيجة لذلك، ينخفض زمن الاستجابة من حوالي 4 ثوانٍ إلى ثانية واحدة تقريبًا للعبارات القصيرة.
قام المؤلف بتطوير WhisperType، وهي أداة إملاء مجانية ومفتوحة المصدر (رخصة MIT) لأنظمة ويندوز 10/11 بإصدار 64 بت. تتيح الأداة إدخال الصوت في أي نافذة عبر مفتاح اختصار، وتعمل دون اتصال بالإنترنت وبدون الحاجة إلى صلاحيات المسؤول، وتستخدم نموذجًا محليًا يُدعى deepdml/faster-whisper-large-v3-turbo-ct2 (باستخدام CTranslate2، وبنوع بيانات int8_float32). المشكلة الرئيسية هي أن مشفر Whisper يعالج دائمًا نافذة زمنية ثابتة مدتها 30 ثانية، لذا حتى العبارة القصيرة تستغرق حوالي 4 ثوانٍ على المعالج المركزي. الحل هو تعديل دالة pad_or_trim بطريقة غير رسمية لتضييق نافذة التشفير وفقًا لطول الكلام الفعلي. كما يتم تعطيل الطوابع الزمنية عند تضييق النافذة، ويُستخدم أسلوب نصي لإزالة التكرارات النادرة. وللإملاءات الطويلة، تم تنفيذ التعرف على الكلام المتدفق: حيث يتم قص الصوت عند فترات التوقف ومعالجته في أجزاء أثناء استمرار التسجيل. يتم اختيار العدد الأمثل من الخيوط تلقائيًا كعدد المعالجات المنطقية ناقص اثنين. تحسينات إضافية: اكتشاف اللغة بشكل صريح، وتدفق صوتي مفتوح دائمًا، ونموذج مُسخّن مسبقًا، واستيراد مؤجل، وفحوصات للصمت وفشل أجهزة الصوت. يستخدم الكود على مستوى النظام فقط ctypes و WinAPI، متجنبًا مكتبات الخطافات.
المصدر: Habr — хаб ML —
الأصلي
