Nghiên cứuSinh phương tiện 🇺🇸 27.07.2026 02:04

Real World VoiceEQ Ra Mắt: Chuẩn Mực Mới Đánh Giá Chất Lượng AI Giọng Nói

Hume AIHume AI
Hume AI ra mắt Real World VoiceEQ, một chuẩn mực để đánh giá tương tác giọng nói chất lượng con người. Dựa trên hơn một triệu đánh giá của con người, nó bao gồm hơn 40 mô hình với hơn 60 chỉ số, bao gồm ASR (nhận dạng giọng nói tự động), TTS (chuyển văn bản thành giọng nói), S2S (chuyển giọng nói thành giọng nói) và hiểu giọng nói. Chuẩn mực này cho thấy không có mô hình đơn lẻ nào xuất sắc ở tất cả các hạng mục và nêu bật điểm yếu của các hệ thống hiện tại trong việc nhận diện cảm xúc và ngữ cảnh.
Nhóm phát triển Hume AI đã giới thiệu chuẩn đánh giá Real World VoiceEQ, được thiết kế để đánh giá chất lượng trí tuệ nhân tạo giọng nói từ góc nhìn con người. Chuẩn này đánh giá hơn 40 mô hình giọng nói AI hàng đầu, cả độc quyền và mã nguồn mở, trên 15+ khía cạnh chính và 60+ chỉ số, bao gồm nhận dạng giọng nói tự động (ASR), chuyển văn bản thành giọng nói (TTS), chuyển giọng nói thành giọng nói (S2S) và hiểu giọng nói. Chuẩn đánh giá dựa trên hơn 1 triệu đánh giá cá nhân của con người, được thu thập từ các nhóm nhân khẩu học đa dạng, phong cách nói và môi trường âm thanh khác nhau. Phiên bản hiện tại bao gồm 785.000 đánh giá TTS và 48.000 đánh giá S2S, trở thành một trong những nghiên cứu có sự tham gia của con người lớn nhất về chất lượng giọng nói AI. Các đánh giá được thực hiện trên nền tảng Kairos. Theo kết quả, không có một hệ thống nào xếp hạng trong top 5 trên tất cả tám nhóm năng lực, cho thấy không có một mô hình giọng nói “tốt nhất” duy nhất. Các mô hình giọng nói thành giọng nói cho thấy sự khác biệt lớn nhất: một số mô hình hoạt động tốt trong việc nhận diện cảm xúc nhưng không thể phản hồi tự nhiên. Hóa ra, việc truy cập vào âm thanh không đảm bảo rằng các tác nhân sử dụng thông tin ngoài ngôn ngữ—nhiều hệ thống vẫn phụ thuộc vào bản ghi, bỏ qua giọng điệu, khoảng dừng, sự ngập ngừng, ngữ điệu và âm lượng. Chuẩn đánh giá cũng cho thấy các mô hình hoạt động kém hơn với giọng nói có trọng âm, giọng nói chồng lấn, cảm xúc, tiếng ồn nền và hội thoại dài. Tỷ lệ lỗi từ (WER) đối với giọng nói ồn cao gấp khoảng bốn lần so với nền nhạc. Ngoài ra, một số mô hình dường như được tối ưu hóa cho các chuẩn đánh giá tiêu chuẩn, tái tạo các lỗi đã biết từ các bản ghi tham chiếu. So sánh giữa các mô hình ngôn ngữ giọng nói (SLM) hàng đầu với các đánh giá viên con người đã được đào tạo cho thấy sự thống nhất cao nhất ở các tác vụ có câu trả lời đúng rõ ràng, nhưng giảm dần ở các đánh giá chủ quan—ví dụ: ghép giọng nói với một vai diễn hoặc bảo tồn danh tính. Các đánh giá tự động chưa thể thay thế con người khi phán đoán phụ thuộc vào bối cảnh âm thanh và diễn giải xã hội.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới