ModelosCódigo Abierto 🇨🇳 28.07.2026 19:03

Alibaba lanza Qwen2-Audio: nuevo modelo de audio-lenguaje con chat de voz y análisis

Alibaba/QwenAlibaba/Qwen
Alibaba presentó Qwen2-Audio, una nueva versión del modelo de audio-lenguaje que admite chat de voz sin ASR, análisis de sonidos, música y habla, así como más de 8 idiomas. Los modelos Qwen2-Audio-7B y Qwen2-Audio-7B-Instruct están disponibles de forma abierta en Hugging Face y ModelScope. Su rendimiento supera los anteriores SOTA en varios benchmarks.
Alibaba ha lanzado Qwen2-Audio, la siguiente versión de Qwen-Audio, capaz de aceptar entradas de audio y texto para generar texto. Por primera vez, los usuarios pueden dar comandos de voz sin módulos ASR (Reconocimiento Automático del Habla). El modelo puede analizar información de audio (voz, sonidos, música) según instrucciones de texto y admite más de 8 idiomas, incluyendo chino, inglés, cantonés, francés, italiano, español, alemán y japonés. Los pesos de los modelos Qwen2-Audio-7B y Qwen2-Audio-7B-Instruct están disponibles de forma abierta en Hugging Face y ModelScope. En los benchmarks LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound y AIR-Benchmark, Qwen2-Audio supera significativamente a los anteriores SOTA (State of the Art) y a Qwen-Audio. La arquitectura se basa en el modelo de lenguaje Qwen y un codificador de audio; el entrenamiento incluye preentrenamiento multitarea, ajuste fino supervisado (Supervised Fine-Tuning) y optimización directa de preferencias (Direct Preference Optimization). En el futuro, se planea entrenar en conjuntos de datos más grandes, admitir audio de más de 30 segundos y modelos más grandes.
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas