النماذجمفتوح المصدر 🇺🇸 24.07.2026 00:05

أفضل نماذج التعرف على الكلام مفتوحة المصدر لعام 2026: مقارنة WER واللغات وزمن الاستجابة والتراخيص

CohereCohere IBMIBM NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral KyutaiKyutai MetaMeta OpenAIOpenAI
لم يعد سوق التعرف على الكلام مفتوح المصدر مقتصرًا على نموذج Whisper؛ فخلال الـ 12 شهرًا الماضية، ظهرت العديد من النماذج المنافسة. القادة في لوحة صدارة التعرف على الكلام مفتوح المصدر تفصل بينهم أقل من نقطة مئوية واحدة في معدل الخطأ في الكلمات (WER)، لذا أصبحت العوامل الحاسمة هي الترخيص، وتغطية اللغات، ودعم البث المباشر، والتكلفة لكل ساعة من الصوت. تقارن المقالة النماذج الرئيسية بالتفصيل عبر هذه المعايير وتقدم توصيات للاختيار.
على مدار الـ 12 شهرًا الماضية، توقف سوق التعرف التلقائي على الكلام مفتوح المصدر (ASR) عن كونه أحادي الثقافة مع Whisper. في مارس 2026، أصدرت Cohere نموذج Transcribe (2 مليار معلمة، رخصة Apache 2.0)، الذي تصدر قائمة Open ASR Leaderboard على Hugging Face بمتوسط WER قدره 5.42%. بعد خمسة أسابيع، أصدرت IBM نموذج Granite Speech 4.1 2B بنتيجة 5.33%، ثم أظهرت نماذج ARK-ASR-3B و MOSS-Transcribe-preview-2B قيمًا أقل. الآن، يفصل بين قادة القائمة أقل من نقطة مئوية واحدة في WER، مما يجعل القائمة ليست المعيار الوحيد للاختيار. الأمور المهمة هي الرخصة، تغطية اللغات، دعم البث، والتكلفة لكل ساعة صوت. تشير المقالة إلى أن متوسط WER في القائمة ليس قيمة ثابتة: تم اختبار النماذج على مجموعات بيانات مختلفة. على سبيل المثال، أظهر Cohere Transcribe 5.42% على ثماني مجموعات اختبار إنجليزية بما في ذلك TED-LIUM، بينما أظهر ARK-ASR-3B 5.04% على سبع مجموعات بدون TED-LIUM، مما يرفع متوسطه. إذا أُعيد حساب Cohere على نفس المجموعات السبع، سيكون WER الخاص به 5.84%، و Granite Speech 4.1 2B سيكون 5.65%. بعض النماذج مثل MOSS-Transcribe-preview-2B تم ضبطها بدقة مع التعزيز على أقسام التدريب في القائمة، مما يرفع نتائجها. مجموعات الاختبار الخاصة من Appen تغير الترتيب في القائمة: عليها، يحتل zoom/scribe_v1 المركز الأول. من بين النماذج البارزة: Cohere Transcribe — 2 مليار معلمة، Apache 2.0، 14 لغة، تم تحميله أكثر من 620,000 مرة في الشهر؛ Granite Speech 4.1 2B — Apache 2.0، 6 لغات، ASR + ترجمة كلام ثنائية الاتجاه، RTFx 231.29؛ Canary-Qwen-2.5B — 2.5 مليار معلمة، CC-BY-4.0، اللغة الإنجليزية، WER 5.63%، RTFx 418؛ Qwen3-ASR-1.7B — Apache 2.0، 52 لغة ولهجة، WER 5.76%. في فئة الإنتاجية، يتصدر: Parakeet TDT 0.6B v3 (0.6 مليار معلمة، CC-BY-4.0، RTFx 3332.74، 25 لغة أوروبية، WER 6.32%)، Granite Speech 4.1 2B-NAR (غير تلقائي، RTFx ~1820) و Qwen3-ASR-0.6B (52 لغة، RTFx ~2000). للبث: Voxtral Mini 4B Realtime 2602 (Apache 2.0، 13 لغة، زمن وصول من 80 مللي ثانية، يعمل على GPU بسعة 16 جيجابايت) و Kyutai STT (CC-BY-4.0، الإنجليزية/الفرنسية، زمن وصول 0.5 ثانية، مع VAD دلالي مدمج). Meta Omnilingual ASR (Apache 2.0) يدعم أكثر من 1600 لغة بشكل أصلي وما يصل إلى 5400+ لغة عبر التعلم بدون أمثلة. يظل Whisper large-v3 (MIT، 99 لغة) الخيار الأفضل للمشاريع التي تكون فيها الأعباء الترخيصية البسيطة مهمة. من بين المستجدات البحثية: diffusion-gemma-asr-small (توليد إزالة التشويش بالانتشار المتوازي، 42 مليون معلمة مدربة) و MOSS-Transcribe-Diarize 0.9B (Apache 2.0، أكثر من 50 لغة، يؤدي التعرف والفصل الصوتي في مسار واحد). التقسيم الترخيصي: Apache 2.0 (Cohere Transcribe, Granite Speech, Qwen3-ASR, Voxtral Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe)، MIT (Whisper large-v3) و CC-BY-4.0 (Canary-Qwen, Parakeet, Kyutai STT). Meta تقسم التراخيص: Apache 2.0 للنماذج، CC-BY للمجموعة. يُوصى باختيار النموذج بالترتيب التالي: الرخصة، تغطية اللغات، وضع البث أو الدُفعات، ثم قياس WER على بياناتك الصوتية الخاصة وحساب التكلفة لكل ساعة صوت على أجهزتك. الاستنتاج الرئيسي: النموذج مفتوح المصدر بحجم 2 مليار معلمة ورخصة متسامحة يتفوق الآن على ما كانت تقدمه واجهات برمجة التطبيقات المغلقة قبل 18 شهرًا، ويختزل الاختيار إلى قرار شراء وليس بحثي.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة