Alibaba lança Qwen2-Audio: novo modelo de áudio-linguagem com chat por voz e análise
Alibaba/Qwen
A Alibaba apresentou o Qwen2-Audio — uma nova versão do modelo de áudio-linguagem que suporta chat por voz sem ASR, análise de sons, música e fala, além de mais de 8 idiomas. Os modelos Qwen2-Audio-7B e Qwen2-Audio-7B-Instruct estão abertos no Hugging Face e ModelScope. O desempenho supera o SOTA anterior em vários benchmarks.
A Alibaba lançou o Qwen2-Audio, a próxima versão do Qwen-Audio, capaz de receber entradas de áudio e texto e gerar texto. Pela primeira vez, os usuários podem dar comandos de voz sem módulos ASR. O modelo é capaz de analisar informações de áudio (fala, sons, música) a partir de instruções de texto e suporta mais de 8 idiomas, incluindo chinês, inglês, cantonês, francês, italiano, espanhol, alemão e japonês. Os pesos dos modelos Qwen2-Audio-7B e Qwen2-Audio-7B-Instruct estão abertos no Hugging Face e no ModelScope. Nos benchmarks LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound e AIR-Benchmark, o Qwen2-Audio supera significativamente os anteriores State-of-the-Art e o Qwen-Audio. A arquitetura é baseada no modelo de linguagem Qwen e em um codificador de áudio, e o treinamento inclui pré-treinamento multitarefa, fine-tuning supervisionado e otimização direta de preferência. No futuro, está planejado o treinamento em conjuntos de dados maiores, suporte a áudios com mais de 30 segundos e modelos maiores.
Fonte: Alibaba Qwen —
original
