ModelleForschung 🇨🇳 28.07.2026 19:03

Qwen2-VL: Alibaba veröffentlicht neue Generation von Vision-Language-Modellen mit SoTA-Leistung

Alibaba/QwenAlibaba/Qwen
Alibaba hat Qwen2-VL vorgestellt, eine neue Generation von Vision-Language-Modellen, die ihren Vorgänger in Bezug auf Bildverständnis, Video und multimodale Agentenfähigkeiten deutlich übertreffen. Die Modelle 2B und 7B sind unter der Apache-2.0-Lizenz quelloffen, während 72B über die API verfügbar ist. Qwen2-VL-72B zeigt eine Leistung, die GPT-4o und Claude 3.5-Sonnet bei vielen Benchmarks übertrifft, insbesondere beim Verständnis von Dokumenten.
Alibaba hat Qwen2-VL veröffentlicht, eine neue Generation von Vision-Language-Modellen auf Basis von Qwen2. Die Modelle 2B und 7B sind unter der Apache-2.0-Lizenz als Open Source verfügbar, während 72B über eine API zugänglich ist. Qwen2-VL erzielt State-of-the-Art-Ergebnisse in den Benchmarks MathVista, DocVQA, RealWorldQA und MTVQA. Das Modell ist in der Lage, Videos mit einer Länge von über 20 Minuten zu verstehen und sich in Geräte für automatische Operationen zu integrieren. Es unterstützt Mehrsprachigkeit, darunter europäische Sprachen, Japanisch, Koreanisch, Arabisch und Vietnamesisch. Qwen2-VL verwendet einen Vision Transformer mit 600 Millionen Parametern und unterstützt dynamische Auflösung. Eingeführt wurde das multimodale Positions-Embedding M-ROPE (Multimodal Rotary Position Embedding), das gleichzeitig Text-, Bild- und Videoinformationen erfasst. Das Modell zeigt Überlegenheit beim Verständnis von Dokumenten und bei der Lösung von Aufgaben und übertrifft GPT-4o sowie Claude 3.5-Sonnet. Einschränkungen des Modells: Keine Audio-Extraktion aus Videos, Wissensstand bis Juni 2023, Schwierigkeiten beim Zählen und Erkennen von Symbolen.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten