Qwen VLo: Modelo unificado de comprensión y generación multimodal de Alibaba
Alibaba/Qwen
Alibaba lanza Qwen VLo, un modelo multimodal unificado que comprende y genera imágenes. Soporta edición abierta, instrucciones multilingües, resolución dinámica y generación progresiva de arriba a abajo y de izquierda a derecha. Disponible como vista previa en Qwen Chat.
Alibaba presenta Qwen VLo, un nuevo modelo multimodal unificado que puede comprender y generar imágenes. Se trata de una mejora respecto a la serie anterior QwenVL, uniendo percepción y creación. Utiliza un método de generación progresiva, construyendo las imágenes gradualmente de izquierda a derecha y de arriba abajo. Qwen VLo admite una comprensión precisa del contenido, edición basada en instrucciones abiertas (transferencia de estilo, modificación de objetos, cambio de fondo), instrucciones multilingües (chino e inglés) y resolución dinámica con relaciones de aspecto arbitrarias. También puede realizar tareas de percepción visual, como predicción de mapas de profundidad, segmentación y detección de bordes mediante comandos de edición. El modelo se encuentra en fase de vista previa y está disponible a través de Qwen Chat. Entre las limitaciones se incluyen imprecisiones e inconsistencias ocasionales.
Fuente: Alibaba Qwen —
original
