अनुप्रयोगशोध 🇷🇺 12.08.2026 09:03

PVAD: कैसे AI को शोरगुल वाले कमरे में सही व्यक्ति की आवाज़ सुनना सिखाएं

सिंगुलारिस टीम ने PVAD विकसित किया, जो एक सामान्य ऑडियो स्ट्रीम में किसी विशिष्ट व्यक्ति के बोलने का पता लगाने की तकनीक है, जिसका उद्देश्य उनकी आवाज़ को अलग करना है जबकि पृष्ठभूमि शोर और अन्य आवाज़ों को दबाना है। उन्होंने 100 से अधिक प्रयोग किए, जिसमें आवाज़ गतिविधि का पता लगाने के लक्ष्य मेट्रिक्स हासिल किए, लेकिन वे स्टेट-ऑफ़-द-आर्ट डीनॉइज़िंग परिणामों को दोहरा नहीं सके, जो इस दृष्टिकोण की सीमाओं को उजागर करता है।
सिंगुलारिस टीम ने PVAD (पर्सनल वॉयस एक्टिविटी डिटेक्शन) पर काम किया, जो एक तकनीक है जिससे यह पता चलता है कि ऑडियो स्ट्रीम में कोई विशेष व्यक्ति कब बोल रहा है। लक्षित वक्ता के छोटे वॉयस सैंपल के आधार पर, सिस्टम को भाषण खंडों की पहचान करनी थी, पृष्ठभूमि शोर और अन्य आवाज़ों को दबाना था, और बिना वक्ता पृथक्करण के एक अत्याधुनिक डीनॉइज़िंग दृष्टिकोण को दोहराने का भी प्रयास करना था। परियोजना में डेमुक्स को आधार के रूप में इस्तेमाल किया गया, जिसे ResNet आर्किटेक्चर और x-vector तकनीक से वॉयस एम्बेडिंग के साथ बढ़ाया गया, साथ ही कल्डी, पायटॉर्च और टेंसरफ्लो का उपयोग किया गया। प्रशिक्षण और मूल्यांकन के लिए लिब्रीस्पीच और वॉक्ससेलेब2 सहित बड़े सार्वजनिक डेटासेट का उपयोग किया गया, जिनका कुल आकार 1 टेराबाइट से अधिक है, साथ ही छोटे ग्राहक डेटासेट भी शामिल थे। 100 से अधिक प्रयोग किए गए, और टीम ने निकट और दूर माइक्रोफोन दोनों स्थितियों में PVAD के लिए लक्षित मेट्रिक्स हासिल किए, जिससे ग्राहक परीक्षण डेटा पर मॉडल की गुणवत्ता में सुधार हुआ। हालाँकि, समय सीमा के भीतर डीनॉइज़र कंटूर अत्याधुनिक स्तर के परिणाम प्राप्त नहीं कर सका, जिसे टीम दृष्टिकोण की प्रयोज्यता के बारे में एक महत्वपूर्ण खोज मानती है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार