ModelosInvestigación 🇨🇳 28.07.2026 00:03

Alibaba Qwen lanza QVQ-Max: modelo de razonamiento visual con evidencia

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ha lanzado oficialmente QVQ-Max, la primera versión de su modelo de razonamiento visual. No solo puede reconocer imágenes y videos, sino también analizarlos, resolviendo tareas desde matemáticas hasta creatividad. Los desarrolladores señalaron que la precisión del modelo en el benchmark MathVision aumenta con la longitud del proceso de pensamiento.
Alibaba Qwen ha presentado QVQ-Max, la primera versión de su modelo de razonamiento visual, que va más allá del QVQ-72B-Preview preliminar lanzado en diciembre. El modelo comprende el contenido de imágenes y videos, los analiza y razona sobre ellos, ayudando a resolver tareas que van desde problemas matemáticos hasta cuestiones cotidianas y creativas. En el benchmark MathVision, que agrega problemas matemáticos multimodales complejos, la precisión del modelo mejora al aumentar la longitud máxima del proceso de pensamiento. QVQ-Max posee tres capacidades clave: observación detallada (detección de objetos, texto y pequeños detalles), razonamiento profundo (inferencias basadas en información visual y conocimientos de fondo) y aplicación flexible (desde resolución de problemas hasta creación de ilustraciones y guiones). Entre los ejemplos de demostración se incluyen ayuda en el trabajo (análisis de datos, escritura de código), aprendizaje (resolución de problemas con diagramas) y vida cotidiana (recomendaciones de vestimenta y recetas). Los planes futuros incluyen mejorar la precisión del reconocimiento mediante mecanismos de verificación, desarrollar un agente visual para tareas de múltiples pasos (control de un teléfono inteligente o computadora) y mejorar la interacción agregando herramientas y generación visual.
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas