Qwen2-VL: Alibaba brengt nieuwe generatie visie-taalmodellen uit met topprestaties
Alibaba/Qwen
Alibaba heeft Qwen2-VL gepresenteerd, een nieuwe generatie visie-taalmodellen die hun voorganger aanzienlijk overtreffen op het gebied van beeld- en videobegrip en multimodale agentmogelijkheden. De modellen van 2B en 7B zijn open source onder de Apache 2.0-licentie, terwijl de 72B-variant beschikbaar is via een API. De Qwen2-VL-72B presteert beter dan GPT-4o en Claude 3.5-Sonnet op veel benchmarks, met name op het gebied van documentbegrip.
Alibaba heeft Qwen2-VL uitgebracht, een nieuwe generatie vision-language modellen gebaseerd op Qwen2. De 2B- en 7B-modellen zijn open-source onder de Apache 2.0-licentie, terwijl de 72B-versie beschikbaar is via een API. Qwen2-VL behaalt state-of-the-art resultaten op de benchmarks MathVista, DocVQA, RealWorldQA en MTVQA. Het model kan video's van meer dan 20 minuten begrijpen en integreren met apparaten voor automatische operaties. Het ondersteunt meertaligheid, waaronder Europese talen, Japans, Koreaans, Arabisch en Vietnamees. Qwen2-VL gebruikt een Vision Transformer met 600 miljoen parameters en ondersteunt dynamische resolutie. Het introduceert een multimodale positionele embedding genaamd M-ROPE voor het gelijktijdig vastleggen van tekstuele, visuele en video-informatie. Het model toont superieure prestaties in documentbegrip en probleemoplossing, waarbij het GPT-4o en Claude 3.5-Sonnet overtreft. Beperkingen van het model zijn onder andere het ontbreken van audio-extractie uit video's, kennis tot juni 2023, en moeite met tellen en tekenherkenning.
Bron: Alibaba Qwen —
origineel
