Генерация синтетических данных для перевода со смешением русского и казахского языков
Meta
Исследователи из MWS AI и нескольких университетов разработали метод генерации синтетических параллельных корпусов для перевода русско-казахского код-свитчинга (смешение языков). Используя замену слов на основе SimAlign, они дообучили модели, такие как NLLB-3.3B, достигнув оценки 3.09/5 по результатам человеческой оценки, превзойдя коммерческие системы (2.80-3.49), несмотря на ограничения синтетических данных.
Переключение между русским и казахским языками распространено в Казахстане, однако обучающих данных для моделей машинного перевода практически нет. Исследователи из MWS AI и партнерских университетов создали синтетический набор данных, взяв существующие параллельные корпуса казахского и русского языков (юридические документы, пресс-релизы) и искусственно вставив русские слова в казахские
Показать ещё ↓
Источник: Habr — хаб ML —
оригинал
