Các nhà khoa học Đại học St. Petersburg cải thiện khả năng đối thoại của mạng nơ-ron
Các nhà ngôn ngữ học tại Đại học Tổng hợp St. Petersburg (SPbU) đã cải thiện khả năng đối thoại của mạng nơ-ron bằng cách nhúng mô hình ngữ điệu, giúp phát âm của trí tuệ nhân tạo (AI) tự nhiên hơn. Phát triển này dự kiến sẽ nâng cao các hệ thống chuyển văn bản thành giọng nói được sử dụng trong trợ lý giọng nói và robot hình người. Kết quả nghiên cứu đã được công bố trong kỷ yếu của Hội nghị Quốc tế về Giọng nói và Máy tính.
Các nhà ngôn ngữ học tại Đại học Tổng hợp Quốc gia Saint Petersburg (SPbU) đã cải thiện khả năng đối thoại của một mạng nơ-ron bằng cách tích hợp một mô hình ngữ điệu, giúp cách phát âm của AI (trí tuệ nhân tạo) trở nên tự nhiên và gần gũi hơn với con người. Sự phát triển này nhằm cải thiện các hệ thống chuyển văn bản thành giọng nói (text-to-speech) được sử dụng trong trợ lý ảo và robot có hình dạng giống người. Kết quả nghiên cứu đã được công bố trong tuyển tập bài báo của Hội nghị Quốc tế về Giọng nói và Máy tính (International Conference on Speech and Computer).
Các hệ thống dựa trên AI hiện đã có thể thay thế hoàn toàn hoặc một phần con người trong nhiều công việc, đặc biệt là các công việc mang tính lặp lại, nhưng ngữ điệu vẫn là một yếu tố khó thực hiện. Ngữ điệu đóng vai trò quan trọng trong việc biểu đạt cảm xúc, thái độ và ý nghĩa giao tiếp, chẳng hạn như phân biệt một câu hỏi với một câu khẳng định. Các mô hình ngôn ngữ truyền thống thường tạo ra ngữ điệu đơn điệu hoặc không phù hợp.
Các nhà ngôn ngữ học của SPbU đã sử dụng mô hình Tacotron2 để tổng hợp giọng nói từ văn bản và huấn luyện mô hình này bằng một hệ thống phân loại ngữ điệu chuyên biệt do SPbU phát triển. Hệ thống phân loại này bao gồm nhiều dạng ngữ điệu khác nhau, có tính đến biên độ giai điệu, tốc độ nói và loại câu. Những cải tiến này giúp mạng nơ-ron khắc phục được những hạn chế về ngữ điệu thiếu tự nhiên hoặc đơn điệu.
Trong một cuộc đánh giá, 42 người nói tiếng Nga bản ngữ đã nghe các đoạn âm thanh tổng hợp và nhìn chung nhận thấy chúng tự nhiên, chỉ có một vài lỗi nhỏ. Trong một thí nghiệm thứ hai, những người tham gia có thể nhận biết các câu hỏi dễ dàng hơn. Các nhà nghiên cứu đề xuất tiếp tục tinh chỉnh mô hình với các biến thể về cảm xúc và phong cách để nâng cao chất lượng hơn nữa.
Nguồn: CNews —
bản gốc
