중국 모델 SenseNova U1.5-Lite-Preview, 네이티브 4K 출력으로 오픈 소스화
SenseTime
센스타임(SenseTime)이 경량 네이티브 통합 멀티모달 모델인 SenseNova U1.5-Lite-Preview를 공개하고 오픈 소스로 배포했습니다. 이 모델은 4K 이미지를 직접 생성할 수 있으며, 복잡한 프롬프트, 참조 이미지, 다중 이미지 합성, 정밀 편집을 지원하여 AI 이미지 생성 및 편집 기능의 발전을 보여줍니다.
센스타임(SenseTime)이 경량 네이티브 통합 멀티모달 모델의 초기 프리뷰 버전인 SenseNova U1.5-Lite-Preview를 오픈소스 커뮤니티에 공개했다. 자체 개발한 NEO-Unify 아키텍처를 기반으로 구축된 이 모델은 언어, 시각적 의미, 픽셀 생성을 하나의 프레임워크 안에서 모델링하며, 시각적 이해, 추론, 생성, 편집을 모두 포괄한다. 파라미터 규모는 8B-MoT(80억 규모 Mixture-of-Transformers)로 작은 편이지만, 길고 복잡한 다중 제약 조건과 계층적·구조적 시각 지시를 처리할 수 있어 포스터나 인포그래픽처럼 정보 밀도가 높은 콘텐츠 제작에 특히 강점을 보인다. 이 모델은 생성 이후 편집 기능도 지원하는데, 참조 이미지 활용, 다중 이미지 합성, 그리고 빨간 상자·좌표·마커를 이용한 정밀한 국소 편집 등이 가능하다. 시연에서는 영화 테마의 인포그래픽을 우편 배송 여정을 표현한 그래픽으로 변환하는 등 디자인 프레임워크를 복제하고 응용하는 능력을 보여주었으며, '迎(영)'이라는 글자를 '命(명)'으로 바꾸는 것처럼 시각적 요소를 재구성해 단일 문자를 수정하는 것도 가능했다. 또한 이 모델은 여러 참조 이미지를 결합할 수 있어, 실제 사진을 손으로 그린 듯한 레시피 이미지로 바꾸거나 인물 사진을 한 페이지짜리 이력서로 변환하는 작업도 수행했다. 센스노바(SenseNova)는 생성 헤드를 재설계해 네이티브 해상도를 4K까지 끌어올렸으며, 이를 통해 격자 형태의 아티팩트를 줄이고 질감 표현을 개선했다. 벤치마크 성능도 향상되었는데, Qwen-Image-Bench 점수는 47.14에서 55.20으로, ImgEdit-Bench는 3.90에서 4.37로, GEdit-Bench 영어 버전은 7.47에서 8.17로, 중국어 버전은 7.42에서 8.05로 각각 상승했으며, WeEdit 종합 평균 점수는 6.44를 기록했다. U1.5의 정식 버전은 곧 오픈소스로 공개될 예정이다. 관련 링크는 GitHub, Hugging Face, ModelScope에서 확인할 수 있다.
출처: QbitAI 量子位 —
원문
