Qwen2-VL: Alibaba veröffentlicht neue Generation von Vision-Language-Modellen mit SoTA-Leistung
Alibaba/Qwen
Alibaba hat Qwen2-VL vorgestellt, eine neue Generation von Vision-Language-Modellen, die den Vorgänger in den Bereichen Bildverständnis, Video und multimodale Agentenfähigkeiten deutlich übertreffen. Die Modelle mit 2 Milliarden und 7 Milliarden Parametern sind unter der Apache-2.0-Lizenz veröffentlicht, während das 72-Milliarden-Parametermodell über eine API verfügbar ist. Qwen2-VL-72B zeigt eine Leistung, die GPT-4o und Claude 3.5 Sonnet in vielen Benchmarks, insbesondere beim Dokumentenverständnis, übertrifft.
Alibaba hat Qwen2-VL veröffentlicht, eine neue Generation von Vision-Language-Modellen auf Basis von Qwen2. Die Modelle 2B und 7B sind unter der Apache-2.0-Lizenz als Open Source verfügbar, während 72B über eine API zugänglich ist. Qwen2-VL erzielt State-of-the-Art-Ergebnisse in den Benchmarks MathVista, DocVQA, RealWorldQA und MTVQA. Das Modell ist in der Lage, Videos mit einer Länge von über 20 Minuten zu verstehen und sich in Geräte für automatische Operationen zu integrieren. Es unterstützt Mehrsprachigkeit, darunter europäische Sprachen, Japanisch, Koreanisch, Arabisch und Vietnamesisch. Qwen2-VL verwendet einen Vision Transformer mit 600 Millionen Parametern und unterstützt dynamische Auflösung. Eingeführt wurde das multimodale Positions-Embedding M-ROPE (Multimodal Rotary Position Embedding), das gleichzeitig Text-, Bild- und Videoinformationen erfasst. Das Modell zeigt Überlegenheit beim Verständnis von Dokumenten und bei der Lösung von Aufgaben und übertrifft GPT-4o sowie Claude 3.5-Sonnet. Einschränkungen des Modells: Keine Audio-Extraktion aus Videos, Wissensstand bis Juni 2023, Schwierigkeiten beim Zählen und Erkennen von Symbolen.
Quelle: Alibaba Qwen —
Original
