الأبحاثالنماذج 🇺🇸 27.07.2026 10:05

إطلاق لوحة متصدرة FFASR — معيار لتقييم التعرف على الكلام في الظروف الصوتية الحقيقية

Treble TechnologiesTreble Technologies Hugging FaceHugging Face OpenAIOpenAI IBMIBM CohereCohere MetaMeta SpeechBrainSpeechBrain
أطلقت Treble Technologies وHugging Face لوحة FFASR المتصدرة، وهي أول معيار مفتوح للمجتمع لتقييم أنظمة التعرف الآلي على الكلام (ASR) في ظروف المجال البعيد. يُظهر المعيار أنه عند انخفاض نسبة الإشارة إلى الضوضاء (SNR)، تكون معدلات خطأ التعرف في المجال البعيد أعلى بعدة مرات من المجال القريب. تتيح المنصة تقييم كل من الدقة (معدل خطأ الكلمة، WER) والسرعة (معامل الوقت الفعلي، RTFx) للنماذج.
أعلنت شركتا Treble Technologies وHugging Face عن إطلاق FFASR Leaderboard، وهو أول معيار مرجعي مفتوح ومُدار من قبل المجتمع لتقييم نماذج التعرف التلقائي على الكلام (ASR) في ظروف واقعية للمجال البعيد مع بيئات صوتية معقدة، تشمل الصدى والضوضاء وبُعد الميكروفون. يستخدم المعيار المرجعي محاكي Treble الهجين، الذي يجمع بين محلل الموجات للترددات المنخفضة والمتوسطة مع الصوتيات الهندسية للترددات العالية، مما يتيح محاكاة دقيقة للظواهر الفيزيائية في 14 غرفة مختلفة تتراوح أحجامها من 20 إلى 470 مترًا مكعبًا. يتم التقييم وفقًا لتسعة شروط، أربعة منها تشكل الترتيب الرئيسي، بالإضافة إلى مسارات للتحقق من صحة المحاكاة (المقاسة مخبريًا والمحاكاة مخبريًا) ونسخة تجريبية بمصدر صوت متحرك. لكل تقديم، يتم تسجيل معدل خطأ الكلمات (WER) للتسعة شروط ومعامل RTFx (الثواني الصوتية لكل ثانية استدلال) على معالج NVIDIA L4 GPU. تظهر نتائج جميع النماذج المُقدمة فجوة ثابتة: يكون WER في المجال البعيد عند نسبة إشارة إلى ضوضاء (SNR) منخفضة أعلى بعدة مرات منه في المجال القريب، ويوضح تصور حدود باريتو (Pareto front) المفاضلة بين الدقة والسرعة. يدعم المعيار المرجعي بنى Whisper وIBM Granite Speech وCohere Transcribe وWav2Vec2 وHuBERT وSpeechBrain وغيرها عبر Hub، كما يمكن إنشاء مُقيّم مخصص لتركيبات معقدة. يخطط المطورون لإضافة سيناريوهات بمتحدثين متعددين ودعم المصفوفات الميكروفونية وإلغاء الصدى.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة