⚡ EILMELDUNG
ModelleMediengenerierung 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Sees, Hears, Speaks, Writes – All in One

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen hat Qwen2.5-Omni veröffentlicht, ein Flaggschiff-Multimodalmodell, das Text, Bilder, Audio und Video verarbeiten sowie Echtzeit-Sprache generieren kann. Das Modell verwendet die Thinker-Talker-Architektur und übertrifft ähnliche Modelle in allen Modalitäten.
Alibaba Qwen hat Qwen2.5-Omni vorgestellt, ein neues Flaggschiff-Modell der Qwen-Serie, das für umfassende multimodale Wahrnehmung entwickelt wurde. Das Modell verarbeitet Text, Bilder, Audio und Video und generiert Streaming-Antworten in Form von Text oder natürlicher Sprache. Die Thinker-Talker-Architektur umfasst einen Thinker, der Eingaben versteht, und einen Talker, der Sprache erzeugt. Das Modell ist auf Hugging Face, ModelScope, DashScope und GitHub verfügbar. Qwen2.5-Omni übertrifft Qwen2.5-VL-7B und Qwen2-Audio bei Audioaufgaben, ist bei Video und Bildern vergleichbar und erzielt Spitzenergebnisse auf OmniBench. Das Modell zeigt zudem hohe Genauigkeit bei Spracherkennung, Übersetzung, Audioverständnis und Sprachgenerierung. Zukünftige Pläne umfassen die Verbesserung der Befolgung von Sprachbefehlen und die Integration weiterer Modalitäten.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten