Alibaba maakt Qwen2.5-VL-32B open-source: slimmer en lichter
Alibaba/Qwen
Alibaba heeft Qwen2.5-VL-32B-Instruct open-source gemaakt, een visie-taalmodel met 32 miljard parameters, onder Apache 2.0. Het presteert beter dan Mistral-Small-3.1-24B en Gemma-3-27B-IT, en overtreft zelfs het grotere Qwen2-VL-72B-Instruct op multimodale redeneerbenchmarks zoals MMMU en MathVista. Het model is geoptimaliseerd via reinforcement learning voor betere menselijke afstemming en wiskundig redeneren.
Het Qwen-team van Alibaba heeft de release aangekondigd van Qwen2.5-VL-32B-Instruct, een visie-taalmodel met 32 miljard parameters, dat is open-sourced onder Apache 2.0. Het model bouwt voort op de Qwen2.5-VL-serie en is geoptimaliseerd met behulp van reinforcement learning (versterkend leren). Belangrijke verbeteringen omvatten reacties die beter zijn afgestemd op menselijke voorkeuren, verbeterde nauwkeurigheid van wiskundige redeneringen en fijnmazig begrip en redenering van afbeeldingen. In uitgebreide benchmarks presteert Qwen2.5-VL-32B-Instruct beter dan vergelijkbare state-of-the-art (SOTA) modellen zoals Mistral-Small-3.1-24B en Gemma-3-27B-IT, en overtreft het zelfs het grotere Qwen2-VL-72B-Instruct op complexe multimodale taken zoals MMMU, MMMU-Pro en MathVista. Het behaalt ook topprestaties op het gebied van puur tekstuele vaardigheden op dezelfde schaal. Het team is van plan zich vervolgens te richten op lange en effectieve redeneerprocessen voor zeer complexe visuele redeneertaken.
Bron: Alibaba Qwen —
origineel
