используя существующие параллельные корпуса (юридические документы и пресс-релизы) и метод SimAlign, который заменяет казахские слова на русские с учётом контекста. Такой подход (cs-5) оказался эффективнее грубой замены. На синтетических данных дообучили модели mBART, M2M100, NLLB-600 и NLLB-3.3B, а также обучили с нуля transformer-600. По автоматическим метрикам (BLEU, ChrF++, COMET) коммерческие системы перевода превзошли все открытые модели. Однако при ручной оценке носителями по шкале Ликерта (от 1 до 5) лучшая модель авторов набрала 3,09, в то время как коммерческие системы получили 2,80 и 3,49. Также добавление переведённых на казахский русскоязычных твитов из корпуса Рыбаковой дало небольшой прирост качества. Авторы признают ограничения: синтетические данные неидеальны (средняя оценка естественности 2,62/5), тестовый корпус мал (618 предложений), автоматические метрики не совпадают с ручной оценкой, сравнение с коммерческими API некорректно (неизвестны их модели), а переносимость на другие языки не проверена.