PVAD: Cách dạy AI nghe đúng người trong phòng ồn ào
Nhóm Singularis đã phát triển PVAD, một công nghệ phát hiện khi một người cụ thể nói trong luồng âm thanh tổng quát, nhằm cô lập giọng nói của họ trong khi triệt tiêu tiếng ồn nền và các giọng nói khác. Họ đã tiến hành hơn 100 thí nghiệm, đạt được các chỉ số mục tiêu cho phát hiện hoạt động giọng nói, nhưng không thể tái tạo kết quả khử nhiễu ở mức độ SOTA, làm nổi bật những hạn chế của phương pháp này.
Đội ngũ Singularis đã nghiên cứu và phát triển PVAD (Phát hiện hoạt động giọng nói cá nhân), một công nghệ xác định thời điểm một người cụ thể nói trong luồng âm thanh. Dựa trên mẫu giọng nói ngắn của người nói mục tiêu, hệ thống phải xác định các đoạn hội thoại, loại bỏ tiếng ồn nền và giọng nói khác, đồng thời cũng cố gắng tái tạo một phương pháp khử nhiễu tiên tiến mà không cần tách người nói. Dự án sử dụng Demucs làm nền tảng, tăng cường với các vector nhúng giọng nói từ kiến trúc ResNet và công nghệ x-vector, cùng với Kaldi, PyTorch và TensorFlow. Việc huấn luyện và đánh giá sử dụng các bộ dữ liệu công khai lớn bao gồm LibriSpeech và VoxCeleb2, tổng dung lượng hơn 1 terabyte, cùng với các bộ dữ liệu nhỏ của khách hàng. Hơn 100 thí nghiệm đã được tiến hành, và đội ngũ đã đạt được các chỉ số mục tiêu cho PVAD trong cả điều kiện mic gần và mic xa, cải thiện chất lượng mô hình trên dữ liệu thử nghiệm của khách hàng. Tuy nhiên, đường bao khử nhiễu không thể đạt được kết quả ở mức tiên tiến nhất trong thời gian giới hạn, điều mà đội ngũ coi là một phát hiện quan trọng về khả năng áp dụng của phương pháp này.
Nguồn: Habr — хаб ИИ —
bản gốc
