ModellenOpen Source 🇨🇳 28.07.2026 19:03

Alibaba brengt Qwen2-Audio uit: nieuwe audio-taalmodel met spraakchat en analyse

Alibaba/QwenAlibaba/Qwen
Alibaba heeft Qwen2-Audio gepresenteerd, een nieuwe versie van de audio-taalmodel die spraakchat zonder ASR ondersteunt, evenals analyse van geluiden, muziek en spraak, en meer dan 8 talen. De modellen Qwen2-Audio-7B en Qwen2-Audio-7B-Instruct zijn openbaar beschikbaar op Hugging Face en ModelScope. De prestaties overtreffen eerdere state-of-the-art resultaten op verschillende benchmarks.
Alibaba heeft Qwen2-Audio uitgebracht, de volgende versie van Qwen-Audio, die audio- en tekstinvoer kan verwerken en tekst kan genereren. Voor het eerst kunnen gebruikers spraakopdrachten geven zonder ASR-modules. Het model kan audio-informatie (spraak, geluiden, muziek) analyseren op basis van tekstinstructies en ondersteunt meer dan acht talen, waaronder Chinees, Engels, Kantonees, Frans, Italiaans, Spaans, Duits en Japans. De gewichten van de modellen Qwen2-Audio-7B en Qwen2-Audio-7B-Instruct zijn openbaar beschikbaar op Hugging Face en ModelScope. In de benchmarks LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound en AIR-Benchmark presteert Qwen2-Audio aanzienlijk beter dan de eerdere state-of-the-art en Qwen-Audio. De architectuur is gebaseerd op het taalmodel Qwen en een audio-encoder; de training omvat multi-task pre-training, supervised finetuning en direct preference optimization. In de toekomst zijn er plannen voor training op grotere datasets, ondersteuning voor audio langer dan 30 seconden en grotere modellen.
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws