Qwen2-VL: Alibaba veröffentlicht neue Generation von Vision-Language-Modellen mit SoTA-Leistung
Alibaba hat Qwen2-VL vorgestellt, eine neue Generation von Vision-Language-Modellen, die ihren Vorgänger in Bezug auf Bildverständnis, Video und multimodale Agentenfähigkeiten deutlich übertreffen. Die Modelle 2B und 7B sind unter der Apache-2.0-Lizenz quelloffen, während 72B über die API verfügbar ist. Qwen2-VL-72B zeigt eine Leistung, die GPT-4o und Claude 3.5-Sonnet bei vielen Benchmarks übertrifft, insbesondere beim Verständnis von Dokumenten.
Alibaba/Qwen



