Как переводить смешанный русский и казахский с помощью синтетических данных
Исследователи из MWS AI и нескольких университетов разработали метод генерации синтетического датасета для перевода смешанного русско-казахского языка (код-свитчинга). Их подход, основанный на выравнивании SimAlign и модели NLLB-3.3B, позволил обойти коммерческие системы по ручной оценке, хотя автоматические метрики показывают обратное.
Meta
Habr — хаб ML26.07 · 19:05
