모델미디어 생성 🇨🇳 27.07.2026 18:04

알리바바의 Qwen VLo: 통합 멀티모달 이해 및 생성 모델

Alibaba/QwenAlibaba/Qwen
알리바바가 Qwen VLo를 출시했습니다. 이는 이미지를 이해하고 생성할 수 있는 통합 멀티모달 모델로, 개방형 편집, 다국어 명령, 동적 해상도, 위에서 아래로, 왼쪽에서 오른쪽으로 점진적 생성을 지원합니다. Qwen Chat에서 프리뷰로 제공됩니다.
알리바바가 Qwen VLo를 출시했습니다. 이는 이미지를 이해하고 생성할 수 있는 새로운 통합 멀티모달 모델로, 기존 QwenVL 시리즈에서 업그레이드된 제품입니다. 이 모델은 인식과 생성 사이의 간극을 메우며, 점진적 생성 방식을 사용해 이미지를 왼쪽에서 오른쪽으로, 위에서 아래로 단계적으로 구성합니다. Qwen VLo는 정확한 콘텐츠 이해, 개방형 명령 기반 편집(스타일 전환, 객체 수정, 배경 변경), 다국어 명령(중국어 및 영어), 동적 해상도 및 임의 종횡비를 지원합니다. 또한 편집 명령을 통해 깊이 맵 예측, 세그멘테이션, 에지 검출과 같은 시각적 인식 작업을 수행할 수 있습니다. 이 모델은 프리뷰 단계에 있으며 Qwen Chat을 통해 이용할 수 있습니다. 한계로는 가끔 부정확성과 불일치가 발생할 수 있다는 점이 있습니다.
출처: Alibaba Qwen — 원문
관련 게시물 ↓
새로운 뉴스