모델연구 🇷🇺 06.08.2026 07:03

러시아 IT 받아쓰기를 위한 23개 ASR 모델 벤치마크: 3월 추천은 이제 구식

OpenAIOpenAI
한 개발자가 러시아어 IT 받아쓰기용 음성-텍스트 모델을 재평가하여, 60개 이상의 구성에서 23개 ASR 모델을 100,000회 실행으로 테스트했습니다. 그들은 예상치 못한 발견인 Breeze ASR이 Whisper Large v3와 맞먹거나 능가한다는 것을 확인하고, 추천 모델을 업데이트했습니다. 이 벤치마크는 복합 지표 Q를 도입했는데, 이는 단어 오류율(WER), 구두점 정확도, 그리고 영어 용어를 라틴 문자로 유지하는 모델에 보상을 주는 새로운 영어 보존 지수(EPI)를 결합한 것입니다.
3월에 저자는 러시아어 IT 받아쓰기에 Whisper Large v3를 추천했지만, 나중에 대만식 중국어에 최적화되고 코드 스위칭을 지원하는 Breeze ASR 모델을 발견했는데, 이 모델이 최소한 그와 동등한 성능을 보였습니다. 이를 검증하기 위해 저자는 엄격한 벤치마크를 구축했습니다: 60개 이상의 구성에서 23개 모델, RTX 5070 Ti에서 120시간 이상의 추론을 사용한 러시아어-영어 IT 코퍼스에서 10만 회 이상의 실행이 이루어졌습니다. 코퍼스에는 저자와 그의 아내 두 명의 화자가 다양한 밀도의 영어 IT 용어가 포함된 장문의 텍스트를 읽는 내용이 포함되어 있습니다. 복합 지표 Q(0.65 WER + 0.10 문장 부호 + 0.25 EPI)는 단어 정확도, 문장 부호 품질, 영어 용어의 라틴 문자 보존을 균형 있게 평가합니다. WER은 음역을 불이익하지 않도록 정규화되며, EPI는 정식 영어 형태를 보상하고 불완전한 라틴 문자 보존에 부분적으로 가산점을 부여합니다. 결과는 Breeze ASR이 이 벤치마크에서 Whisper Large v3를 능가하여 3월의 추천이 구식이 되었음을 보여줍니다. 저자는 또한 여러 문장 부호 프롬프트를 테스트했고, 맞춤 프롬프트가 문장 부호를 크게 개선한다는 것을 발견했습니다. 대화형 벤치마크 페이지는 다양한 받아쓰기 시나리오에 맞게 가중치를 조정할 수 있게 해줍니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스