ModelosCódigo Aberto 🇨🇳 28.07.2026 16:03

Alibaba lança Qwen2.5-VL: novo modelo multimodal flagship

Alibaba/QwenAlibaba/Qwen
A Alibaba apresentou o Qwen2.5-VL, nova geração de modelo de visão-linguagem, disponível nos tamanhos 3B, 7B e 72B. O modelo apresenta compreensão visual aprimorada, suporte a vídeos com mais de uma hora de duração, capacidade de ações agênticas e saída estruturada.
A equipe Qwen da Alibaba lançou o Qwen2.5-VL, um novo modelo principal para visão e linguagem. Ele está disponível em três tamanhos: 3B, 7B e 72B, tanto nas versões base quanto instruct, no Hugging Face e no ModelScope. O modelo pode reconhecer objetos, textos, diagramas e também atuar como um agente visual: controlar um computador ou telefone. Ele compreende vídeos com duração superior a uma hora e é capaz de localizar eventos no tempo. O modelo suporta localização precisa de objetos por meio de bounding boxes e pontos-chave, além de saída estruturada em JSON para documentos, faturas e tabelas. O modelo principal, Qwen2.5-VL-72B-Instruct, apresenta resultados competitivos em benchmarks, incluindo tarefas de nível universitário, matemática, compreensão de documentos e vídeos. As versões menores (7B) superam o GPT-4o-mini em diversas tarefas, e a versão 3B, destinada a edge AI, supera o modelo anterior de 7B. O reconhecimento de imagens também foi aprimorado: agora, o modelo abrange uma enorme quantidade de categorias, incluindo plantas, animais, pontos turísticos, personagens de filmes e produtos. O modelo utiliza o formato HTML para marcação de documentos (QwenVL HTML).
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas