Qwen VLo: uniform multimodaal begrips- en generatiemodel van Alibaba
Alibaba/Qwen
Alibaba brengt Qwen VLo uit, een uniform multimodaal model dat zowel afbeeldingen begrijpt als genereert. Het ondersteunt open einde bewerking, meertalige instructies, dynamische resolutie en progressieve generatie van boven naar beneden en van links naar rechts. Beschikbaar als preview op Qwen Chat.
Alibaba introduceert Qwen VLo, een nieuw uniform multimodaal model dat zowel afbeeldingen kan begrijpen als genereren. Het model is een upgrade ten opzichte van de eerdere QwenVL-serie en overbrugt perceptie en creatie. Het gebruikt een progressieve generatiemethode, waarbij afbeeldingen geleidelijk van links naar rechts en van boven naar beneden worden opgebouwd. Qwen VLo ondersteunt nauwkeurig inhoudsbegrip, open instructiegebaseerde bewerking (stijloverdracht, objectwijziging, achtergrondverandering), meertalige instructies (Chinees en Engels) en dynamische resolutie met willekeurige beeldverhoudingen. Het kan ook visuele perceptietaken uitvoeren, zoals dieptekaartvoorspelling, segmentatie en randdetectie via bewerkingsopdrachten. Het model bevindt zich in de previewfase en is beschikbaar via Qwen Chat. Beperkingen zijn onder meer incidentele onnauwkeurigheden en inconsistenties.
Bron: Alibaba Qwen —
origineel
