ModèlesOpen Source 🇨🇳 28.07.2026 19:03

Alibaba lance Qwen2-Audio : un nouveau modèle audio-langage avec chat vocal et analyse

Alibaba/QwenAlibaba/Qwen
Alibaba a présenté Qwen2-Audio, une nouvelle version de son modèle audio-langage, prenant en charge le chat vocal sans reconnaissance automatique de la parole, l'analyse des sons, de la musique et de la parole, ainsi que plus de 8 langues. Les modèles Qwen2-Audio-7B et Qwen2-Audio-7B-Instruct sont ouverts sur Hugging Face et ModelScope. Leurs performances surpassent les précédents modèles de pointe sur plusieurs bancs d'essai.
Alibaba a publié Qwen2-Audio, la version suivante de Qwen-Audio, capable de recevoir des entrées audio et textuelles et de générer du texte. Pour la première fois, les utilisateurs peuvent donner des commandes vocales sans modules de reconnaissance automatique de la parole. Le modèle peut analyser des informations audio (parole, sons, musique) selon des instructions textuelles et prend en charge plus de 8 langues, dont le chinois, l'anglais, le cantonais, le français, l'italien, l'espagnol, l'allemand et le japonais. Les poids des modèles Qwen2-Audio-7B et Qwen2-Audio-7B-Instruct sont ouverts sur Hugging Face et ModelScope. Dans les benchmarks LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound et AIR-Benchmark, Qwen2-Audio dépasse largement les précédents SOTA et Qwen-Audio. L'architecture repose sur le modèle de langage Qwen et un encodeur audio ; l'entraînement comprend un préentraînement multitâche, un fine-tuning supervisé et une optimisation directe des préférences. À l'avenir, il est prévu d'entraîner sur des ensembles de données plus vastes, de prendre en charge des audios de plus de 30 secondes et de développer des modèles plus grands.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches