Alibaba phát hành Qwen2-Audio: mô hình ngôn ngữ âm thanh mới với trò chuyện giọng nói và phân tích
Alibaba/Qwen
Alibaba đã giới thiệu Qwen2-Audio - phiên bản mới của mô hình ngôn ngữ âm thanh, hỗ trợ trò chuyện giọng nói mà không cần ASR (Automatic Speech Recognition - Nhận dạng giọng nói tự động), phân tích âm thanh, nhạc và lời nói, cùng hơn 8 ngôn ngữ. Các mô hình Qwen2-Audio-7B và Qwen2-Audio-7B-Instruct được công bố mở trên Hugging Face và ModelScope. Hiệu năng vượt trội so với SOTA (State-Of-The-Art - tiên tiến nhất) trước đây trên nhiều điểm chuẩn.
Alibaba đã phát hành Qwen2-Audio, phiên bản tiếp theo của Qwen-Audio, có khả năng nhận đầu vào âm thanh và văn bản, đồng thời tạo ra văn bản. Lần đầu tiên, người dùng có thể ra lệnh bằng giọng nói mà không cần các mô-đun nhận dạng giọng nói tự động (ASR). Mô hình có thể phân tích thông tin âm thanh (lời nói, âm thanh, nhạc) theo hướng dẫn văn bản và hỗ trợ hơn 8 ngôn ngữ, bao gồm tiếng Trung, tiếng Anh, tiếng Quảng Đông, tiếng Pháp, tiếng Ý, tiếng Tây Ban Nha, tiếng Đức và tiếng Nhật. Trọng số của các mô hình Qwen2-Audio-7B và Qwen2-Audio-7B-Instruct đã được mở trên Hugging Face và ModelScope. Trong các bài benchmark LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound và AIR-Benchmark, Qwen2-Audio vượt trội hơn đáng kể so với các mô hình tiên tiến nhất (SOTA) trước đây và Qwen-Audio. Kiến trúc dựa trên mô hình ngôn ngữ Qwen và bộ mã hóa âm thanh; quá trình huấn luyện bao gồm tiền huấn luyện đa nhiệm, tinh chỉnh có giám sát và tối ưu hóa ưu tiên trực tiếp. Trong tương lai, dự kiến sẽ huấn luyện trên các tập dữ liệu lớn hơn, hỗ trợ âm thanh dài hơn 30 giây và các mô hình lớn hơn.
Nguồn: Alibaba Qwen —
bản gốc
