математических рассуждений, а также детальное понимание и рассуждение на основе изображений. В ходе обширного бенчмаркинга Qwen2.5-VL-32B-Instruct превосходит современные модели сопоставимого масштаба, такие как Mistral-Small-3.1-24B и Gemma-3-27B-IT, и даже опережает более крупную Qwen2-VL-72B-Instruct в сложных мультимодальных задачах, таких как Massive Multi-discipline Multimodal Understanding (MMMU), MMMU-Pro и MathVista. Она также достигает высокой производительности в чисто текстовых задачах на том же масштабе. Команда планирует сосредоточиться на длительных и эффективных процессах рассуждения для особо сложных задач визуального анализа.