Nghiên cứu 🇷🇺 26.07.2026 19:05

Tạo dữ liệu tổng hợp cho dịch chuyển mã Nga-Kazakh hỗn hợp

MetaMeta
Các nhà nghiên cứu từ MWS AI và một số trường đại học đã phát triển một phương pháp tạo kho ngữ liệu song song tổng hợp để dịch chuyển mã Nga-Kazakh (hỗn hợp ngôn ngữ). Sử dụng phương pháp thay thế từ dựa trên SimAlign, họ tinh chỉnh các mô hình như NLLB-3.3B, đạt điểm đánh giá của con người là 3.09/5, vượt trội so với các hệ thống thương mại (2.80-3.49) bất chấp giới hạn của dữ liệu tổng hợp.
Việc chuyển đổi ngôn ngữ giữa tiếng Nga và tiếng Kazakh rất phổ biến ở Kazakhstan, nhưng hầu như không có dữ liệu huấn luyện cho các mô hình dịch máy. Các nhà nghiên cứu từ MWS AI và các trường đại học đối tác đã tạo ra một tập dữ liệu tổng hợp bằng cách lấy các kho ngữ liệu song ngữ Kazakh-Nga hiện có (tài liệu pháp lý, thông cáo báo chí) và chèn nhân tạo các từ tiếng Nga vào câu tiếng Kazakh bằng cách sử dụng SimAlign, công cụ lựa chọn các từ thay thế dựa trên ngữ cảnh thông qua các phép nhúng. Họ đã tinh chỉnh một số mô hình mã nguồn mở (mBART, M2M100, NLLB-600, NLLB-3.3B) trên dữ liệu tổng hợp này. Mặc dù các hệ thống thương mại đạt điểm số cao hơn trên các chỉ số tự động (BLEU, ChrF++, COMET), một đánh giá của con người sử dụng thang Likert cho thấy mô hình NLLB-3.3B đã tinh chỉnh đạt 3,09/5, vượt qua hai API thương mại (2,80 và 3,49). Phương pháp này cũng cải thiện hiệu suất khi thêm dữ liệu Twitter được dịch sang tiếng Kazakh. Tuy nhiên, dữ liệu tổng hợp chỉ được đánh giá 2,62/5 về độ tự nhiên, tập kiểm tra nhỏ (618 câu) và khả năng chuyển giao cho các cặp ngôn ngữ khác vẫn chưa chắc chắn.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới