Исследования 🇷🇺 26.07.2026 19:05

Генерация синтетических данных для перевода со смешением русского и казахского языков

MetaMeta
Исследователи из MWS AI и нескольких университетов разработали метод генерации синтетических параллельных корпусов для перевода русско-казахского код-свитчинга (смешение языков). Используя замену слов на основе SimAlign, они дообучили модели, такие как NLLB-3.3B, достигнув оценки 3.09/5 по результатам человеческой оценки, превзойдя коммерческие системы (2.80-3.49), несмотря на ограничения синтетических данных.
Переключение между русским и казахским языками распространено в Казахстане, однако обучающих данных для моделей машинного перевода практически нет. Исследователи из MWS AI и партнерских университетов создали синтетический набор данных, взяв существующие параллельные корпуса казахского и русского языков (юридические документы, пресс-релизы) и искусственно вставив русские слова в казахские
Показать ещё ↓
Источник: Habr — хаб ML — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости