إطلاق Real World VoiceEQ: معيار جديد لتقييم جودة الذكاء الاصطناعي الصوتي
Hume AI
أطلقت Hume AI معيار Real World VoiceEQ لتقييم التفاعل الصوتي البشري عالي الجودة. استنادًا إلى أكثر من مليون تصنيف بشري، يغطي المعيار أكثر من 40 نموذجًا عبر أكثر من 60 مقياسًا، بما في ذلك التعرف التلقائي على الكلام (ASR)، وتحويل النص إلى كلام (TTS)، والكلام إلى كلام (S2S)، وفهم الكلام. كشف المعيار أنه لا يوجد نموذج واحد يتفوق في جميع الفئات، وسلط الضوء على نقاط الضعف الحالية في التعرف على العواطف والسياق.
أطلق فريق Hume AI معيار Real World VoiceEQ، المصمم لتقييم جودة الذكاء الاصطناعي الصوتي من منظور بشري. يقوم المعيار بتقييم أكثر من 40 نموذجًا صوتيًا رائدًا مملوكًا ومفتوح المصدر عبر أكثر من 15 بُعدًا رئيسيًا وأكثر من 60 مقياسًا، تشمل التعرف التلقائي على الكلام (ASR)، وتحويل النص إلى كلام (TTS)، وتحويل الكلام إلى كلام (S2S)، وفهم الكلام. يعتمد المعيار على أكثر من مليون تقييم بشري فردي، جُمعت عبر مجموعات ديموغرافية متنوعة وأنماط كلام وبيئات صوتية مختلفة. تتضمن النسخة الحالية 785,000 تقييم TTS و48,000 تقييم S2S، مما يجعله واحدًا من أكبر الدراسات البشرية في الحلقة المغلقة لجودة الذكاء الصوتي. أُجريت التقييمات على منصة Kairos. وفقًا للنتائج، لا يوجد نظام واحد يحتل المراكز الخمسة الأولى عبر جميع المجموعات الثمانية للقدرات، مما يسلط الضوء على عدم وجود نموذج صوتي واحد "الأفضل". أظهرت نماذج تحويل الكلام إلى كلام أكبر تباين: بعضها أدى بشكل جيد في التعرف على المشاعر ولكنها لم تستطع الاستجابة بشكل طبيعي. اتضح أن الوصول إلى الصوت لا يضمن أن العوامل تستخدم المعلومات شبه اللغوية—فالعديد من الأنظمة لا تزال تعتمد على النصوص، متجاهلة النبرة والتوقفات والتردد والنغمة ومستوى الصوت. كشف المعيار أيضًا أن النماذج تؤدي بشكل أسوأ مع الكلام ذي اللهجة، الأصوات المتداخلة، المشاعر، الضوضاء الخلفية، والحوارات الطويلة. كانت معدلات خطأ الكلمات للكلام المزعج أعلى بنحو أربع مرات مقارنة بخلفية موسيقية. بالإضافة إلى ذلك، يبدو أن بعض النماذج مُحسَّنة للمعايير القياسية، حيث تعيد إنتاج أخطاء معروفة من النصوص المرجعية. أظهرت مقارنة نماذج اللغة الصوتية الرائدة (SLMs) مع المقيمين البشريين المدربين أن التوافق يكون أعلى في المهام ذات الإجابات الصحيحة الواضحة ولكنه ينخفض في التقييمات الذاتية—على سبيل المثال، مطابقة الصوت مع دور تمثيلي أو الحفاظ على الهوية. لا يزال المقيمون التلقائيون غير قادرين على استبدال البشر عندما يعتمد الحكم على السياق الصوتي والتفسير الاجتماعي.
المصدر: Hugging Face blog —
الأصلي
