ModellerMedya Üretimi 🇨🇳 27.07.2026 18:04

Alibaba'dan Qwen VLo: Birleşik çok modlu anlama ve üretim modeli

Alibaba/QwenAlibaba/Qwen
Alibaba, hem görüntüleri anlayan hem de üreten birleşik bir çok modlu model olan Qwen VLo'yu yayınladı. Açık uçlu düzenleme, çok dilli talimatlar, dinamik çözünürlük ve yukarıdan aşağıya, soldan sağa aşamalı üretimi destekler. Qwen Chat'te ön izleme olarak mevcuttur.
Alibaba, Qwen VLo'yu tanıttı: görüntüleri hem anlayabilen hem de üretebilen yeni bir birleşik çok modlu model. Bu model, önceki QwenVL serisinden bir yükseltme olup algı ve yaratımı birleştiriyor. Kademeli bir üretim yöntemi kullanarak görüntüleri soldan sağa ve yukarıdan aşağıya aşamalı olarak oluşturuyor. Qwen VLo, hassas içerik anlama, açık uçlu yönerge tabanlı düzenleme (stil aktarımı, nesne değiştirme, arka plan değişimi), çok dilli yönergeler (Çince ve İngilizce) ve değişken çözünürlük ile herhangi bir en-boy oranını destekliyor. Ayrıca düzenleme komutları aracılığıyla derinlik haritası tahmini, bölütleme ve kenar algılama gibi görsel algılama görevlerini de gerçekleştirebiliyor. Model ön izleme aşamasında olup Qwen Chat üzerinden kullanılabiliyor. Sınırlamalar arasında ara sıra yanlışlıklar ve tutarsızlıklar yer alıyor.
Kaynak: Alibaba Qwen — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler