ModelosGeneración de Medios 🇨🇳 03.08.2026 16:02

El modelo chino SenseNova U1.5-Lite-Preview se vuelve de código abierto con salida nativa de 4K

SenseTimeSenseTime
SenseTime ha presentado y liberado como código abierto SenseNova U1.5-Lite-Preview, un modelo unificado multimodal ligero que puede generar imágenes 4K directamente. Soporta indicaciones complejas, imágenes de referencia, composición de múltiples imágenes y edición precisa, lo que supone un avance en las capacidades de generación y edición de imágenes por IA.
SenseTime ha publicado SenseNova U1.5-Lite-Preview, una vista previa temprana de un modelo multimodal unificado nativo y ligero, en la comunidad de código abierto. Construido sobre la arquitectura propia NEO-Unify, modela el lenguaje, la semántica visual y la generación de píxeles dentro de un único marco, abarcando la comprensión visual, el razonamiento, la generación y la edición. A pesar de su pequeño tamaño de parámetros de 8B-MoT, puede manejar instrucciones visuales largas, con múltiples restricciones, jerárquicas y estructuradas, lo que lo hace experto en crear contenido de alta densidad de información como carteles e infografías. El modelo también admite la edición posterior a la generación, incluida la referencia a imágenes, la composición de múltiples imágenes y la edición local precisa mediante cuadros rojos, coordenadas y marcas. Demostró la capacidad de replicar y adaptar marcos de diseño, como convertir una infografía temática de película en un recorrido postal, y de modificar caracteres individuales, como cambiar '迎' por '命', reorganizando los elementos visuales. El modelo también puede combinar múltiples imágenes de referencia, transformando una foto real en una receta dibujada a mano, o un retrato en un currículum de una página. SenseNova rediseñó la cabeza de generación para llevar la resolución nativa a 4K, reduciendo los artefactos de cuadrícula y mejorando el detalle de la textura. El rendimiento mejoró en los puntos de referencia: la puntuación de Qwen-Image-Bench subió de 47.14 a 55.20, ImgEdit-Bench de 3.90 a 4.37, y GEdit-Bench en inglés de 7.47 a 8.17, en chino de 7.42 a 8.05, con el promedio general de WeEdit en 6.44. Se espera que la versión oficial de U1.5 se publique en código abierto pronto. Se proporcionan enlaces en GitHub, Hugging Face y ModelScope.
Fuente: QbitAI 量子位 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas