Alibaba Qwen publie QVQ-Max : un modèle de raisonnement visuel avec preuves
Alibaba/Qwen
Alibaba Qwen a officiellement publié QVQ-Max, la première version de son modèle de raisonnement visuel. Il peut non seulement reconnaître des images et des vidéos, mais aussi les analyser, en résolvant des tâches allant des mathématiques à la créativité. Les développeurs ont noté que la précision du modèle sur le benchmark MathVision augmente avec la durée du processus de réflexion.
Alibaba Qwen a dévoilé QVQ-Max, la première version de son modèle de raisonnement visuel, qui va au-delà de la pré-version QVQ-72B-Preview publiée en décembre. Le modèle comprend le contenu des images et des vidéos, les analyse et raisonne à partir de ceux-ci, aidant à résoudre des problèmes allant des questions mathématiques aux préoccupations quotidiennes et à la créativité. Sur le benchmark MathVision, qui agrège des problèmes mathématiques multimodaux complexes, la précision du modèle s'améliore à mesure que la longueur maximale du processus de réflexion augmente. QVQ-Max possède trois capacités clés : l'observation détaillée (identification d'objets, de texte et de petits détails), le raisonnement approfondi (déductions basées sur des informations visuelles et des connaissances contextuelles) et l'application flexible (de la résolution de problèmes à la création d'illustrations et de scénarios). Parmi les exemples de démonstration figurent l'assistance au travail (analyse de données, écriture de code), l'apprentissage (résolution de problèmes avec des diagrammes) et la vie quotidienne (recommandations vestimentaires et recettes). Les projets futurs incluent l'amélioration de la précision de la reconnaissance via des mécanismes de vérification, le développement d'un agent visuel pour des tâches en plusieurs étapes (contrôle d'un smartphone ou d'un ordinateur) et l'amélioration de l'interaction grâce à l'ajout d'outils et de génération visuelle.
Source: Alibaba Qwen —
original
