Đánh giá 23 mô hình ASR cho đọc chính tả CNTT tiếng Nga: Khuyến nghị tháng 3 của tôi đã lỗi thời
OpenAI
Một nhà phát triển đã đánh giá lại các mô hình chuyển giọng nói thành văn bản cho việc đọc chính tả CNTT tiếng Nga, thử nghiệm 23 mô hình ASR trong hơn 60 cấu hình với 100.000 lần chạy. Họ phát hiện ra rằng Breeze ASR, một phát hiện bất ngờ, đạt hoặc vượt Whisper Large v3, dẫn đến cập nhật khuyến nghị. Bài đánh giá giới thiệu chỉ số tổng hợp Q, kết hợp WER, độ chính xác dấu câu và Chỉ số bảo toàn tiếng Anh mới (EPI) để thưởng cho các mô hình giữ các thuật ngữ tiếng Anh ở dạng chữ Latinh.
Vào tháng 3, tác giả đã giới thiệu Whisper Large v3 cho việc đọc chính tả CNTT bằng tiếng Nga, nhưng sau đó đã phát hiện ra Breeze ASR, một mô hình được tối ưu hóa cho tiếng Quan Thoại Đài Loan với hỗ trợ chuyển mã, hoạt động ít nhất cũng tốt. Để xác minh, họ đã xây dựng một điểm chuẩn nghiêm ngặt: 23 mô hình trong hơn 60 cấu hình, hơn 100.000 lần chạy trên kho ngữ liệu CNTT Nga-Anh, sử dụng hơn 120 giờ suy luận trên RTX 5070 Ti. Kho ngữ liệu bao gồm hai người nói (tác giả và vợ anh ấy) đọc các văn bản dài với mật độ khác nhau của các thuật ngữ CNTT tiếng Anh. Chỉ số tổng hợp Q (0,65 WER + 0,10 punct + 0,25 EPI) cân bằng độ chính xác từ, chất lượng dấu câu và giữ nguyên các thuật ngữ tiếng Anh trong bảng chữ cái Latinh. WER được chuẩn hóa để không phạt các phiên âm, trong khi EPI thưởng cho các dạng tiếng Anh chuẩn và ghi nhận một phần việc giữ nguyên chữ Latinh không hoàn hảo. Kết quả cho thấy Breeze ASR vượt trội hơn Whisper Large v3 trên điểm chuẩn này, khiến khuyến nghị từ tháng 3 trở nên lỗi thời. Tác giả cũng đã thử nghiệm nhiều lời nhắc dấu câu và phát hiện ra rằng một lời nhắc tùy chỉnh cải thiện đáng kể dấu câu. Trang điểm chuẩn tương tác cho phép điều chỉnh trọng số để phù hợp với các tình huống đọc chính tả khác nhau.
Nguồn: Habr — хаб ML —
bản gốc
