연구 🇷🇺 26.07.2026 19:05

러시아어-카자흐어 코드 스위칭 번역을 위한 합성 데이터 생성

MetaMeta
MWS AI와 여러 대학의 연구진이 러시아어-카자흐어 코드 스위칭(언어 혼합) 번역을 위한 합성 병렬 코퍼스 생성 방법을 개발했습니다. SimAlign 기반 단어 대체를 사용하여 NLLB-3.3B 같은 모델을 미세 조정했으며, 인간 평가 점수 3.09/5를 달성하여 상용 시스템(2.80-3.49)을 능가했습니다. 합성 데이터의 한계에도 불구하고 우수한 성능을 보였습니다.
카자흐스탄에서는 러시아어와 카자흐어 간의 코드 스위칭이 흔하지만, 기계 번역 모델을 위한 학습 데이터는 거의 존재하지 않습니다. MWS AI와 파트너 대학의 연구진은 기존의 카자흐어-러시아어 병렬 코퍼스(법률 문서, 보도 자료)를 활용하고 SimAlign을 통해 카자흐어 문장에 러시아어 단어를 인위적으로 삽입하여 합성 데이터셋을 만들었습니다. SimAlign은 임베딩을 기반으로 문맥에 따라 대체 단어를 선택합니다. 연구진은 여러 오픈 모델(mBART, M2M100, NLLB-600, NLLB-3.3B)을 이 합성 데이터로 미세 조정했습니다. 상용 시스템이 자동 평가 지표(BLEU, ChrF++, COMET)에서 더 높은 점수를 기록했지만, 리커트 척도(Likert scale)를 사용한 인간 평가에서는 미세 조정된 NLLB-3.3B 모델이 3.09/5를 기록하여 두 개의 상용 API(2.80, 3.49)를 능가했습니다. 이 접근법은 카자흐어로 번역된 트위터 데이터를 추가했을 때도 성능이 향상되었습니다. 그러나 합성 데이터의 자연스러움 점수는 2.62/5에 불과했고, 테스트 세트는 618개 문장으로 작으며, 다른 언어 쌍으로의 전이 가능성은 아직 불확실합니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스