французский, итальянский, испанский, немецкий и японский. Веса моделей Qwen2-Audio-7B и Qwen2-Audio-7B-Instruct открыты на платформах Hugging Face и ModelScope. В бенчмарках LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound и AIR-Benchmark Qwen2-Audio значительно превосходит предыдущие SOTA (State-of-the-art, передовые разработки) и Qwen-Audio. Архитектура основана на языковой модели Qwen и аудиоэнкодере, обучение включает мультизадачный претрейн, supervised finetuning (дообучение с учителем) и direct preference optimization (оптимизацию прямых предпочтений). В будущем планируется обучение на больших наборах данных, поддержка аудио длиннее 30 секунд и более крупные модели.