ModelleMediengenerierung 🇨🇳 27.07.2026 18:04

Qwen VLo: Einheitliches multimodales Verständnis- und Generierungsmodell von Alibaba

Alibaba/QwenAlibaba/Qwen
Alibaba veröffentlicht Qwen VLo, ein einheitliches multimodales Modell, das Bilder sowohl versteht als auch generiert. Es unterstützt offene Bearbeitung, mehrsprachige Anweisungen, dynamische Auflösung und progressive Generierung von oben nach unten und von links nach rechts. Als Vorschau auf Qwen Chat verfügbar.
Alibaba stellt Qwen VLo vor, ein neues einheitliches multimodales Modell, das Bilder sowohl verstehen als auch generieren kann. Das Modell ist eine Weiterentwicklung der bisherigen QwenVL-Serie und überbrückt Wahrnehmung und Kreation. Es verwendet eine progressive Generierungsmethode, bei der Bilder schrittweise von links nach rechts und von oben nach unten aufgebaut werden. Qwen VLo unterstützt präzises Inhaltsverständnis, offene anweisungsbasierte Bearbeitung (Stilübertragung, Objektänderung, Hintergrundwechsel), mehrsprachige Anweisungen (Chinesisch und Englisch) sowie dynamische Auflösung mit beliebigen Seitenverhältnissen. Über Bearbeitungsbefehle kann es auch visuelle Wahrnehmungsaufgaben wie Tiefenkartenvorhersage, Segmentierung und Kantenerkennung durchführen. Das Modell befindet sich in der Vorschauphase und ist über Qwen Chat verfügbar. Zu den Einschränkungen gehören gelegentliche Ungenauigkeiten und Inkonsistenzen.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten