Qwen VLo: модели, которая объединяет понимание и генерацию изображений
Alibaba/Qwen
Alibaba Qwen представила новую мультимодальную модель Qwen VLo, способную не только понимать изображения, но и генерировать их на основе инструкций пользователя. Модель поддерживает редактирование изображений по текстовым командам, стилизацию, детекцию и сегментацию, работает с несколькими языками и доступна в Qwen Chat в предварительной версии.
Китайская компания Alibaba Qwen анонсировала новую мультимодальную модель Qwen VLo, которая объединяет возможности понимания и генерации изображений. В отличие от предыдущих моделей семейства Qwen (от QwenVL до Qwen2.5 VL), которые в основном «понимали» изображения, Qwen VLo способна создавать изображения на основе текстовых описаний и редактировать загруженные изображения по инструкциям пользователя. Генерация происходит прогрессивно — слева направо и сверху вниз, что позволяет контролировать процесс и добиваться высокого качества. Модель демонстрирует улучшенное понимание контента: например, при запросе «сменить цвет машины» она точно распознает модель автомобиля и сохраняет его структуру. Qwen VLo поддерживает открытые инструкции на естественном языке (стилизация под Ван Гога, добавление объектов, смена фона), многократные модификации в одном запросе (например, создание постера) и работу на нескольких языках, включая китайский и английский. Также модель умеет выполнять классические задачи компьютерного зрения — предсказание карт глубины, сегментацию, детекцию и выделение границ — через простые текстовые команды. Qwen VLo использует динамическое разрешение, позволяя генерировать изображения произвольных размеров и соотношений сторон (вплоть до 4:1 и 1:3, хотя экстремальные форматы пока в разработке). Модель доступна в предварительной версии через Qwen Chat. Разработчики отмечают, что это лишь начало, и в будущем модель будет улучшаться в плане стабильности и точности.
Источник: Alibaba Qwen —
оригинал
