Bảng xếp hạng FFASR ra mắt: Chuẩn đánh giá ASR trong điều kiện âm thanh thực tế
Treble Technologies
Hugging Face
OpenAI
IBM
Cohere
Meta
SpeechBrain
Hugging Face và Treble Technologies vừa ra mắt Bảng xếp hạng Nhận dạng giọng nói trường xa (FFASR), một chuẩn đánh giá cộng đồng mở đầu tiên để đánh giá các mô hình ASR trong điều kiện trường xa thực tế như âm vang, tiếng ồn nền và khoảng cách micrô. Kết quả ban đầu cho thấy tỷ lệ lỗi từ (WER) ở trường xa với SNR thấp cao gấp nhiều lần so với WER ở trường gần, phản ánh khoảng cách đáng kể giữa hiệu suất chuẩn và triển khai thực tế.
FFASR Leaderboard do Hugging Face và Treble Technologies tạo ra là chuẩn đánh giá cộng đồng mở đầu tiên để đánh giá các mô hình ASR trong điều kiện âm thanh trường xa thực tế. Nó giải quyết khoảng cách dai dẳng giữa hiệu suất trên chuẩn đánh giá và triển khai thực tế, nơi các mô hình đạt điểm cao trên các chuẩn đánh giá trường gần tiêu chuẩn thường suy giảm đáng kể dưới tác động của tiếng vang, tiếng ồn nền và khoảng cách microphone. Bảng xếp hạng đánh giá các mô hình trên chín điều kiện, với bốn điều kiện quyết định điểm xếp hạng chính. Dữ liệu âm thanh được tạo ra bằng công cụ mô phỏng lai của Treble, kết hợp mô hình hóa dựa trên sóng và âm học hình học để nắm bắt các hiện tượng như nhiễu xạ và giao thoa. Mười bốn phòng được trang bị nội thất đầy đủ, có diện tích từ 20 đến 470 mét khối. Cùng với WER, bảng xếp hạng báo cáo RTFx (số giây âm thanh trên mỗi giây suy luận) cho mỗi bài nộp, được đánh giá trên GPU NVIDIA L4. Kết quả ban đầu cho thấy WER trường xa ở SNR thấp cao gấp nhiều lần WER trường gần. Bảng xếp hạng hỗ trợ các biến thể Whisper, IBM Granite Speech, Cohere Transcribe, Wav2Vec2, HuBERT, SpeechBrain và hầu hết các kiến trúc ASR khác thông qua việc nộp ID mô hình Hugging Face. Tùy chọn bộ đánh giá tùy chỉnh cho phép các stack suy luận phức tạp hơn. Các kế hoạch tương lai bao gồm các kịch bản nhiều người nói, đánh giá mảng microphone và khử tiếng vang.
Nguồn: Hugging Face blog —
bản gốc
