QVQ-Max: визуальное мышление с доказательствами
Alibaba/Qwen
Alibaba Cloud представила QVQ-Max — первую версию модели визуального мышления, способную анализировать и рассуждать на основе изображений и видео. Модель демонстрирует улучшение точности на бенчмарке MathVision по мере увеличения длины процесса мышления и применяется в рабочих задачах, обучении и повседневной жизни. Разработчики планируют улучшать точность наблюдений, превращать модель в визуального агента и расширять модальности взаимодействия.
Alibaba Cloud официально выпустила QVQ-Max, первую версию модели визуального мышления, которая не только «понимает» содержимое изображений и видео, но и анализирует и рассуждает на основе этой информации для поиска решений. Модель оценивалась на бенчмарке MathVision, агрегирующем сложные мультимодальные математические задачи: по мере увеличения максимальной длины процесса мышления точность модели на этом бенчмарке непрерывно росла. QVQ-Max демонстрирует три ключевых направления способностей: детальное наблюдение (выделение ключевых элементов на изображениях, включая мелкие детали), глубокие рассуждения (вывод заключений на основе визуального контента, например, решение геометрических задач по диаграмме или предсказание событий в видео) и гибкое применение (от решения задач до творчества, например, доработка эскизов, создание сценариев для коротких видео или ролевой контент). Применения модели включают помощь в рабочих задачах (анализ данных, написание кода), учебный ассистент по математике и физике с диаграммами, а также повседневные советы (подбор одежды по фото, руководство по приготовлению новых блюд). В планах развития — более точные наблюдения (через grounding для верификации зрительных выводов), создание визуального агента (многошаговые задачи, управление смартфоном/компьютером, игры) и улучшение взаимодействия за счёт дополнительных модальностей (инструменты проверки, визуальная генерация).
Источник: Alibaba Qwen —
оригинал
