미디어 생성모델 🇨🇳 07.08.2026 08:02

알리바바 영상 모델 완 3.0 공개 베타 시작: 문서와 PPT도 영상으로

Alibaba/QwenAlibaba/Qwen
8월 6일, 알리바바가 비디오 생성 모델 완 3.0의 공개 베타를 시작했습니다. 이 모델은 한 번에 30초 분량의 영상을 생성할 수 있으며, 처음으로 doc, xls, ppt, pdf, md와 같은 문서 형식을 지원합니다. 실제 세계를 정확하게 재현하고 사실적인 인물을 구현하는 것을 목표로 합니다.
8월 6일, 알리바바는 영상 생성 대형 모델(large model) Wan 3.0의 퍼블릭 베타를 시작하며 생성 길이, 범용 창작, 만능 레퍼런스, 실사 복원 측면에서 업그레이드를 단행했다. 이번 모델은 한 번에 30초 길이의 영상을 생성할 수 있어 창작 의도를 충분히 표현할 수 있으며, 텍스트·이미지·오디오·비디오라는 네 가지 기본 모달리티(modality) 외에 doc, xls, ppt, pdf, md 등 문서 형식의 입력을 지원하는 것도 이번이 처음이다. 이 모델은 현실 세계를 정확하게 복원하는 데 주력해, 인물마다 고유한 외모를 갖추고 프레임마다 사실적이면서도 신뢰감 있게 표현된다. 생성 길이의 확장은 가장 직관적인 업그레이드로, 연속 패닝이나 원 컷 촬영과 같은 복잡한 카메라 워크도 구현할 수 있게 됐다. Wan3.0에는 프롬프트를 기반으로 적절한 길이를 자동으로 추천해주는 스마트 길이 기능도 탑재됐다. 이 모델은 영상 생성 모델에서 정보 표현 매체로 전환되고 있으며, 문서와 PPT에서 구조화된 정보를 읽어내고 프롬프트와 결합해 교육용 강의자료, 제품 데모, 비즈니스 보고서 등을 생성할 수 있다. 지원되는 형식은 doc, xls, ppt, pdf, md를 포괄하며, 개별 파일 또는 링크는 100MB, 50페이지를 넘지 않아야 한다. 예를 들어 스마트글라스 관련 PPT를 프롬프트와 함께 업로드하면 완성도 높은 홍보 영상을 얻을 수 있다. 이는 프롬프트를 입력 스케줄링과 표현 제어의 허브로 전환시키는 모델의 강력한 프롬프트 엔지니어링(prompt engineering) 및 지시 이행(instruction-following) 능력에 기반한 것이다. 영상 생성 모델은 콘텐츠 생성 도구에서 생산성 도구로 진화하고 있으며, 사용자들은 선명도뿐 아니라 사실감까지 요구하고 있다. Wan3.0은 실제 장면과 디지털 정보를 모두 정확하게 재현하고 표현하는데, 생성되는 인물은 고유한 얼굴, 세밀한 이목구비와 피부 표현, 자연스럽고 절제된 감정 표현, 그리고 미세한 표정과 신체 동작의 조화를 지향한다. 만능 레퍼런스 작업에서는 캐릭터, 소품, 사운드, 공간 관계, 스타일 등 세밀한 요소들이 안정적으로 유지된다. 차트, 데이터, 인터페이스 콘텐츠 등 디지털 정보의 시각적 품질도 향상되어 질감이 느껴지는 수준에 이르렀다. 이 밖에도 Wan3.0의 영상 편집 기능이 대폭 강화되어 화면, 줄거리, 대사 수정을 지원한다. 다만 음질과 텍스트 정확도 면에서는 여전히 개선의 여지가 있다. Wan3.0은 즉시 Alibaba Cloud Bailian(알리바바 클라우드 바이롄), Wanjing Yike(완징이커), Wanxiang(완샹) 공식 홈페이지, Qianwen(첸원) 창작 PC 버전, IF STUDIO, Duijiu(두이주)에서 퍼블릭 베타로 제공되며, Qianwen 앱에서는 순차적으로 단계적 출시(grayscale rollout)가 이뤄진다. API 가격은 480P, 720P, 1080P 기준 초당 각각 0.3위안, 0.6위안, 1.2위안이며, API 인터페이스는 조만간 전면 개방될 예정이다.
출처: QbitAI 量子位 — 원문
관련 게시물 ↓
새로운 뉴스