أفضل نماذج التعرف على الكلام مفتوحة المصدر لعام 2026: مقارنة WER واللغات وزمن الاستجابة والتراخيص
Cohere
IBM
NVIDIA
Alibaba/Qwen
Mistral
Kyutai
Meta
OpenAI
لقد تنوع مشهد التعرف على الكلام مفتوح المصدر إلى ما هو أبعد من Whisper، حيث حققت عدة نماذج معدل خطأ في الكلمات (WER) أقل من 6% على لوحة المتصدرين المفتوحة للتعرف على الكلام. تشمل التطورات الرئيسية نموذج Cohere Transcribe وIBM Granite Speech 4.1 ونماذج متنوعة للإنتاجية والبث وتغطية اللغات. يؤكد التقرير على أن الترخيص ودعم اللغات والإنتاجية وقدرة البث أصبحت الآن أكثر أهمية من الترتيب الخام في لوحة المتصدرين.
مجال التعرف التلقائي على الكلام (ASR) المفتوح تجاوز نمط ويسبير الأحادي. في مارس 2026، أصدرت كوهير نموذج ترانسكرايب (2 مليار معامل، رخصة أباتشي 2.0) بمتوسط معدل خطأ في الكلمات (WER) يبلغ 5.42%، تلاه نموذج جرانيت سبيتش 4.1 من آي بي إم (2 مليار معامل) بمعدل 5.33%. وسجلت نماذج ARK-ASR-3B وMOSS-ترانسكرايب-بريفيو-2B أرقامًا أقل لاحقًا. ومع ذلك، فإن نتائج لوحات المتصدرين ليست قابلة للمقارنة المباشرة بسبب اختلاف تكوينات مجموعات الاختبار؛ فدرجة كوهير تنخفض من 5.42% إلى 5.84% عند إعادة حسابها على نفس المجموعات السبع المستخدمة في ARK. وتعيد مجموعات التقييم الخاصة من أبين ترتيب التصنيفات. يتمتع نموذج كوهير ترانسكرايب بدعم إنتاجي قوي وتفوق في تفضيل البشر. يقدم نموذج آي بي إم جرانيت سبيتش 4.1 ميزات إضافية مثل التوجيه بالكلمات وعلامات الترقيم. يمكن تشغيل نموذج كاناري-كوين-2.5B في وضعي النسخ أو وضع نموذج اللغة الكبير (LLM). يغطي نموذج Qwen3-ASR 52 لغة. من حيث الإنتاجية، يتصدر نموذج باراكيت TDT 0.6B v3 بمعدل RTFx يبلغ 3332.74، بينما نموذج جرانيت سبيتش 4.2B-NAR غير ذاتي الانحدار. للتدفق، يقدم كل من فوكستريل ميني 4B ريال تايم وكايتاي إس تي تي زمن استجابة منخفضًا. يغطي نموذج أومنيلينجوَل إيه إس آر من ميتا أكثر من 1600 لغة. لا يزال نموذج ويسبير لارج-في3 ذا صلة بفضل ترخيص MIT ونظامه البيئي. نموذج diffusion-gemma-asr من إنترفيز مبتكر معماريًا ولكنه غير قابل للنشر. يدمج نموذج MOSS-ترانسكرايب-ديارايز علامات المتحدثين. تنقسم خيارات التراخيص: رخصة أباتشي 2.0 (كوهير، آي بي إم، كوين)، MIT (ويسبير)، CC-BY-4.0 (كاناري، باراكيت، كايتاي). يُنصح الفرق بالتقييم بناءً على الترخيص، والتغطية اللغوية، والتدفق مقابل الدفعي، ومعدل خطأ الكلمات الفعلي للصوتيات الخاصة بها، والتكلفة لكل ساعة صوتية.
المصدر: MarkTechPost —
الأصلي
