Alibaba veröffentlicht Qwen2.5-VL-32B als Open Source: intelligenter und leichter
Alibaba/Qwen
Alibaba hat das visuelle Sprachmodell Qwen2.5-VL-32B-Instruct mit 32 Milliarden Parametern unter der Apache-2.0-Lizenz als Open Source veröffentlicht. Es übertrifft Mistral-Small-3.1-24B und Gemma-3-27B-IT und schneidet sogar besser ab als das größere Qwen2-VL-72B-Instruct bei multimodalem Reasoning, etwa in den Benchmarks MMMU und MathVista. Das Modell wurde durch Reinforcement Learning optimiert, um eine bessere Ausrichtung auf menschliche Präferenzen und mathematisches Denken zu erreichen.
Das Qwen-Team von Alibaba hat die Veröffentlichung von Qwen2.5-VL-32B-Instruct bekannt gegeben, einem Vision-Language-Modell mit 32 Milliarden Parametern, das unter Apache 2.0 als Open Source bereitgestellt wird. Das Modell baut auf der Qwen2.5-VL-Reihe auf und wurde mittels Reinforcement Learning optimiert. Zu den wichtigsten Verbesserungen gehören Antworten, die stärker auf menschliche Präferenzen abgestimmt sind, eine gesteigerte Genauigkeit beim mathematischen Denken sowie ein feinkörniges Bildverständnis und -denken. In umfangreichen Benchmarks übertrifft Qwen2.5-VL-32B-Instruct vergleichbare Modelle der State-of-the-Art wie Mistral-Small-3.1-24B und Gemma-3-27B-IT und schneidet bei komplexen multimodalen Aufgaben wie MMMU, MMMU-Pro und MathVista sogar besser ab als das größere Qwen2-VL-72B-Instruct. Zudem erzielt es bei reinen Textfähigkeiten auf derselben Skala Spitzenleistungen. Das Team plant, sich als Nächstes auf lange und effektive Denkprozesse für hochkomplexe visuelle Reasoning-Aufgaben zu konzentrieren.
Quelle: Alibaba Qwen —
Original
