Qwen2-VL: Alibaba brengt nieuwe generatie visie-taalmodellen uit met SoTA-prestaties
Alibaba/Qwen
Alibaba heeft Qwen2-VL geïntroduceerd, een nieuwe generatie vision-language-modellen die hun voorganger aanzienlijk overtreffen op het gebied van beeldbegrip, video en multimodale agentmogelijkheden. De modellen van 2B en 7B zijn open source onder de Apache 2.0-licentie, terwijl het 72B-model beschikbaar is via de API. Qwen2-VL-72B levert prestaties die GPT-4o en Claude 3.5-Sonnet overtreffen op veel benchmarks, met name bij het begrijpen van documenten.
Alibaba heeft Qwen2-VL uitgebracht, een nieuwe generatie vision-language modellen gebaseerd op Qwen2. De 2B- en 7B-modellen zijn open-source onder de Apache 2.0-licentie, terwijl de 72B-versie beschikbaar is via een API. Qwen2-VL behaalt state-of-the-art resultaten op de benchmarks MathVista, DocVQA, RealWorldQA en MTVQA. Het model kan video's van meer dan 20 minuten begrijpen en integreren met apparaten voor automatische operaties. Het ondersteunt meertaligheid, waaronder Europese talen, Japans, Koreaans, Arabisch en Vietnamees. Qwen2-VL gebruikt een Vision Transformer met 600 miljoen parameters en ondersteunt dynamische resolutie. Het introduceert een multimodale positionele embedding genaamd M-ROPE voor het gelijktijdig vastleggen van tekstuele, visuele en video-informatie. Het model toont superieure prestaties in documentbegrip en probleemoplossing, waarbij het GPT-4o en Claude 3.5-Sonnet overtreft. Beperkingen van het model zijn onder andere het ontbreken van audio-extractie uit video's, kennis tot juni 2023, en moeite met tellen en tekenherkenning.
Bron: Alibaba Qwen —
origineel
