Qwen VLo: Modelo unificado de compreensão e geração multimodal da Alibaba
Alibaba/Qwen
A Alibaba lança o Qwen VLo, um modelo multimodal unificado que entende e gera imagens. Ele suporta edição aberta, instruções multilíngues, resolução dinâmica e geração progressiva de cima para baixo e da esquerda para a direita. Disponível em pré-visualização no Qwen Chat.
Alibaba apresenta o Qwen VLo, um novo modelo multimodal unificado que pode tanto compreender quanto gerar imagens. O modelo é uma atualização da série QwenVL anterior, unindo percepção e criação. Ele utiliza um método de geração progressiva, construindo imagens gradualmente da esquerda para a direita e de cima para baixo. O Qwen VLo suporta compreensão precisa de conteúdo, edição baseada em instruções abertas (transferência de estilo, modificação de objetos, alteração de fundo), instruções multilíngues (chinês e inglês) e resolução dinâmica com proporções de tela arbitrárias. Ele também pode realizar tarefas de percepção visual, como previsão de mapa de profundidade, segmentação e detecção de bordas, por meio de comandos de edição. O modelo está em fase de pré-visualização e disponível através do Qwen Chat. As limitações incluem imprecisões e inconsistências ocasionais.
Fonte: Alibaba Qwen —
original
