MallitMediatuotanto 🇨🇳 27.07.2026 18:04

Qwen VLo: Alibabin yhtenäinen multimodaalinen ymmärrys- ja generointimalli

Alibaba/QwenAlibaba/Qwen
Alibaba julkaisee Qwen VLo -nimisen yhtenäisen multimodaalisen mallin, joka sekä ymmärtää että tuottaa kuvia. Se tukee avointa editointia, monikielisiä ohjeita, dynaamista resoluutiota ja progressiivista generointia ylhäältä alas ja vasemmalta oikealle. Saatavilla esikatseluna Qwen Chatissa.
Alibaba esittelee Qwen VLo:n, uuden yhtenäisen multimodaalimallin, joka pystyy sekä ymmärtämään että tuottamaan kuvia. Malli on päivitys aiemmasta QwenVL-sarjasta ja yhdistää havaitsemisen ja luomisen. Se käyttää progressiivista generointimenetelmää, jossa kuvia rakennetaan asteittain vasemmalta oikealle ja ylhäältä alas. Qwen VLo tukee tarkkaa sisällön ymmärtämistä, avoimeen ohjeeseen perustuvaa muokkausta (tyylinsiirto, objektin muokkaus, taustan vaihto), monikielisiä ohjeita (kiina ja englanti) sekä dynaamista resoluutiota mielivaltaisilla kuvasuhteilla. Se pystyy myös suorittamaan visuaalisia havaintotehtäviä, kuten syvyyskartan ennustamista, segmentointia ja reunantunnistusta muokkauskomentojen avulla. Malli on esikatseluvaiheessa ja saatavilla Qwen Chatin kautta. Rajoituksia ovat satunnaiset epätarkkuudet ja epäjohdonmukaisuudet.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset