ModelleOpen Source 🇨🇳 28.07.2026 19:03

Alibaba veröffentlicht Qwen2-Audio: neues Audio-Sprachmodell mit Sprachchat und Analyse

Alibaba/QwenAlibaba/Qwen
Alibaba hat Qwen2-Audio vorgestellt – eine neue Version des Audio-Sprachmodells, das Sprachchat ohne ASR, Analyse von Geräuschen, Musik und Sprache sowie über 8 Sprachen unterstützt. Die Modelle Qwen2-Audio-7B und Qwen2-Audio-7B-Instruct sind auf Hugging Face und ModelScope Open Source. Die Leistung übertrifft frühere SOTA-Werte in mehreren Benchmarks.
Alibaba hat Qwen2-Audio veröffentlicht, die nächste Version von Qwen-Audio, die Audio- und Texteingaben verarbeiten und Text generieren kann. Erstmals können Nutzer Sprachbefehle ohne ASR-Module (Automatic Speech Recognition, automatische Spracherkennung) geben. Das Modell kann Audioinformationen (Sprache, Geräusche, Musik) anhand von Textanweisungen analysieren und unterstützt mehr als 8 Sprachen, darunter Chinesisch, Englisch, Kantonesisch, Französisch, Italienisch, Spanisch, Deutsch und Japanisch. Die Gewichte der Modelle Qwen2-Audio-7B und Qwen2-Audio-7B-Instruct sind auf Hugging Face und ModelScope frei verfügbar. In den Benchmarks LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound und AIR-Benchmark übertrifft Qwen2-Audio die bisherigen SOTA-Modelle (State of the Art) und Qwen-Audio deutlich. Die Architektur basiert auf dem Sprachmodell Qwen und einem Audio-Encoder, und das Training umfasst ein Multitask-Pretraining, supervised Finetuning und Direct Preference Optimization. Für die Zukunft ist ein Training mit größeren Datensätzen geplant, ebenso Unterstützung für Audiodateien mit mehr als 30 Sekunden Länge und noch größere Modelle.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten