RechercheModèles 🇷🇺 24.07.2026 10:01

Comment traduire le mélange russe-kazakh sans perdre la tête

Des chercheurs de MWS AI et d'universités ont proposé une méthode pour générer un ensemble de données synthétiques pour la traduction automatique de textes mixtes russe-kazakh (alternance codique). Leur modèle, entraîné sur des données synthétiques, a surpassé les systèmes commerciaux lors de l'évaluation humaine, bien qu'il soit en retard par rapport à eux dans les métriques automatiques.
Au Kazakhstan, les locuteurs mélangent souvent le kazakh et le russe sur les réseaux sociaux et dans la vie quotidienne (code-switching), mais il n'existe presque pas de systèmes de traduction automatique capables de bien traduire ces phrases hybrides, faute de données. Les auteurs de l'étude, issus de MWS AI et de plusieurs universités, ont constitué un corpus de 618 phrases avec code-switching pour l'évaluation, mais cela ne suffit pas pour l'apprentissage. Ils ont donc créé un jeu de données synthétique en utilisant des corpus parallèles existants (documents juridiques et communiqués de presse) et la méthode SimAlign, qui remplace les mots kazakhs par des mots russes en tenant compte du contexte. Cette approche (cs-5) s'est avérée plus efficace qu'un remplacement grossier. Les modèles mBART, M2M100, NLLB-600 et NLLB-3.3B ont été affinés sur les données synthétiques, et un transformer-600 a été entraîné de zéro. Selon les métriques automatiques (BLEU, ChrF++, COMET), les systèmes de traduction commerciaux ont surpassé tous les modèles ouverts. Cependant, lors d'une évaluation manuelle par des locuteurs natifs sur une échelle de Likert (de 1 à 5), le meilleur modèle des auteurs a obtenu 3,09, tandis que les systèmes commerciaux ont obtenu 2,80 et 3,49. De plus, l'ajout de tweets russophones traduits en kazakh issus du corpus de Rybakova a apporté une légère amélioration de la qualité. Les auteurs reconnaissent des limites : les données synthétiques ne sont pas parfaites (score moyen de naturalité de 2,62/5), le corpus de test est petit (618 phrases), les métriques automatiques ne correspondent pas à l'évaluation humaine, la comparaison avec les API commerciales est biaisée (leurs modèles sont inconnus), et la transférabilité à d'autres langues n'a pas été testée.
Source: Habr — хаб ML — original
Nos articles précédents sur ce sujet ↓
Infos fraîches