Alibaba merilis Qwen2-Audio: model audio-bahasa baru dengan obrolan suara dan analisis
Alibaba/Qwen
Alibaba memperkenalkan Qwen2-Audio — versi baru dari model audio-bahasa yang mendukung obrolan suara tanpa ASR, analisis suara, musik, dan ucapan, serta lebih dari 8 bahasa. Model Qwen2-Audio-7B dan Qwen2-Audio-7B-Instruct tersedia secara terbuka di Hugging Face dan ModelScope. Kinerjanya melampaui SOTA sebelumnya di beberapa tolok ukur.
Alibaba telah merilis Qwen2-Audio, versi berikutnya dari Qwen-Audio, yang mampu menerima input audio dan teks serta menghasilkan teks. Untuk pertama kalinya, pengguna dapat memberikan perintah suara tanpa modul ASR. Model ini dapat menganalisis informasi audio (ucapan, suara, musik) berdasarkan instruksi teks dan mendukung lebih dari 8 bahasa, termasuk Mandarin, Inggris, Kanton, Prancis, Italia, Spanyol, Jerman, dan Jepang. Bobot model Qwen2-Audio-7B dan Qwen2-Audio-7B-Instruct telah dibuka di Hugging Face dan ModelScope. Dalam tolok ukur LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound, dan AIR-Benchmark, Qwen2-Audio secara signifikan mengungguli SOTA sebelumnya dan Qwen-Audio. Arsitekturnya didasarkan pada model bahasa Qwen dan encoder audio; pelatihan mencakup prapelatihan multitugas, pemurnian terawasi (supervised finetuning), dan optimalisasi preferensi langsung (direct preference optimization). Ke depannya, direncanakan pelatihan pada kumpulan data yang lebih besar, dukungan untuk audio yang lebih panjang dari 30 detik, dan model yang lebih besar.
Sumber: Alibaba Qwen —
asli
