Qwen2-VL: Alibaba lança nova geração de modelos visão-linguagem com desempenho SoTA
Alibaba/Qwen
A Alibaba apresentou o Qwen2-VL — uma nova geração de modelos visão-linguagem que superam significativamente o predecessor em compreensão de imagens, vídeos e capacidades de agentes multimodais. Os modelos 2B e 7B são abertos sob a licença Apache 2.0, enquanto o 72B está disponível via API. O Qwen2-VL-72B demonstra desempenho superior ao GPT-4o e Claude 3.5-Sonnet em vários benchmarks, especialmente na compreensão de documentos.
A Alibaba lançou o Qwen2-VL, uma nova geração de modelos de linguagem e visão baseados no Qwen2. Os modelos 2B e 7B são de código aberto sob a licença Apache 2.0, enquanto o 72B está disponível via API. O Qwen2-VL alcança resultados de última geração nos benchmarks MathVista, DocVQA, RealWorldQA e MTVQA. O modelo é capaz de compreender vídeos com duração superior a 20 minutos e integrar-se a dispositivos para operações automáticas. Suporta multilinguismo, incluindo idiomas europeus, japonês, coreano, árabe e vietnamita. O Qwen2-VL utiliza um Vision Transformer com 600 milhões de parâmetros e suporta resolução dinâmica. Foi introduzida a codificação posicional multimodal M-ROPE para capturar simultaneamente informações textuais, visuais e de vídeo. O modelo demonstra superioridade na compreensão de documentos e resolução de tarefas, superando GPT-4o e Claude 3.5-Sonnet. As limitações do modelo incluem: ausência de extração de áudio de vídeos, conhecimento até junho de 2023 e dificuldades na contagem e reconhecimento de símbolos.
Fonte: Alibaba Qwen —
original
