PVAD: كيف نعلّم الذكاء الاصطناعي سماع الشخص الصحيح في غرفة مزدحمة بالضجيج
طوّر فريق سينغولاريس تقنية PVAD للكشف عن لحظة تحدث شخص معين ضمن تدفق صوتي عام، بهدف عزل صوته مع كتم الضوضاء الخلفية وأصوات الآخرين. أجروا أكثر من 100 تجربة، وتمكنوا من تحقيق المقاييس المستهدفة لكشف نشاط الصوت، لكنهم لم يستطيعوا تكرار نتائج إزالة الضجيج الحديثة (SOTA)، مما يسلط الضوء على حدود هذا الأسلوب.
عمل فريق Singularis على تقنية PVAD (الكشف الشخصي عن نشاط الصوت)، وهي تقنية تُستخدم لتحديد متى يتحدث شخص معين في دفق صوتي. بناءً على عينة صوتية قصيرة من المتحدث المستهدف، كان على النظام تحديد مقاطع الكلام، وقمع الضوضاء الخلفية والأصوات الأخرى، وكذلك محاولة محاكاة نهج متطور لإزالة الضوضاء دون فصل المتحدثين. استخدم المشروع Demucs كأساس، معززًا بتضمينات صوتية من بنية ResNet وتقنية x-vector، إلى جانب Kaldi وPyTorch وTensorFlow. تم التدريب والتقييم باستخدام مجموعات بيانات عامة كبيرة بما في ذلك LibriSpeech وVoxCeleb2، بإجمالي يزيد عن 1 تيرابايت، بالإضافة إلى مجموعات بيانات صغيرة من العملاء. تم إجراء أكثر من 100 تجربة، وحقق الفريق الأهداف المستهدفة لتقنية PVAD في ظروف الميكروفون القريب والبعيد، مما أدى إلى تحسين جودة النموذج على بيانات اختبار العملاء. ومع ذلك، لم يتمكن مخطط إزالة الضوضاء من تحقيق نتائج بمستوى أحدث ما توصلت إليه التقنيات ضمن المهلة الزمنية، وهو ما يعتبره الفريق اكتشافًا مهمًا حول قابلية تطبيق هذا النهج.
المصدر: Habr — хаб ИИ —
الأصلي
