Qwen2-VL: Alibaba lanza nueva generación de modelos de visión y lenguaje con rendimiento SoTA
Alibaba/Qwen
Alibaba presentó Qwen2-VL, una nueva generación de modelos de visión y lenguaje que superan significativamente a su predecesor en comprensión de imágenes, video y capacidades de agentes multimodales. Los modelos 2B y 7B se publican bajo la licencia Apache 2.0, mientras que el de 72B está disponible a través de API. Qwen2-VL-72B demuestra un rendimiento superior al de GPT-4o y Claude 3.5-Sonnet en muchos puntos de referencia, especialmente en comprensión de documentos.
Alibaba lanzó Qwen2-VL, una nueva generación de modelos de lenguaje y visión basados en Qwen2. Los modelos de 2B y 7B se publican bajo la licencia Apache 2.0, mientras que el de 72B está disponible a través de API. Qwen2-VL alcanza resultados de última generación en los puntos de referencia MathVista, DocVQA, RealWorldQA y MTVQA. El modelo es capaz de comprender videos de más de 20 minutos de duración e integrarse con dispositivos para operaciones automáticas. Es compatible con varios idiomas, incluyendo lenguas europeas, japonés, coreano, árabe y vietnamita. Qwen2-VL utiliza un Vision Transformer con 600 millones de parámetros y admite resolución dinámica. Se introduce el posicionamiento multimodal M-ROPE (Multimodal Rotary Position Embedding) para capturar simultáneamente información textual, visual y de video. El modelo demuestra superioridad en comprensión de documentos y resolución de tareas, superando a GPT-4o y Claude 3.5-Sonnet. Limitaciones del modelo: no extrae audio de videos, conocimientos hasta junio de 2023, dificultades en conteo y reconocimiento de caracteres.
Fuente: Alibaba Qwen —
original
