QVQ : Voir le monde avec sagesse
Alibaba/Qwen
L'équipe Qwen d'Alibaba publie QVQ-72B-Preview, un modèle de raisonnement multimodal open-weight construit sur Qwen2-VL-72B. Il obtient 70,3 sur MMMU et montre de bonnes performances sur les benchmarks de mathématiques et de sciences, bien qu'il présente des limites telles que le mélange de langues et le raisonnement récursif.
L'équipe Qwen d'Alibaba a publié QVQ-72B-Preview, un modèle expérimental open-weight pour le raisonnement multimodal, construit sur Qwen2-VL-72B. QVQ atteint un score de 70,3 sur le benchmark MMMU et montre des améliorations substantielles sur les benchmarks mathématiques comme MathVista, MathVision et OlympiadBench par rapport à son prédécesseur. Cependant, le modèle présente plusieurs limitations, notamment le mélange des langues, le raisonnement récursif, des problèmes de sécurité et des hallucinations potentielles dans le raisonnement visuel multi-étapes. L'équipe prévoit d'intégrer à l'avenir des modalités supplémentaires dans un modèle unifié.
Source: Alibaba Qwen —
original
