ModèlesGénération Média 🇨🇳 03.08.2026 16:02

Le modèle chinois SenseNova U1.5-Lite-Preview passe en open source avec une sortie native 4K

SenseTimeSenseTime
SenseTime a présenté et publié en open source SenseNova U1.5-Lite-Preview, un modèle multimodal unifié natif et léger capable de générer directement des images en 4K. Il prend en charge les prompts complexes, les images de référence, la composition multi-images et l'édition précise, marquant une avancée dans les capacités de génération et d'édition d'images par intelligence artificielle.
SenseTime a publié SenseNova U1.5-Lite-Preview, un aperçu préliminaire d'un modèle multimodal unifié natif léger, destiné à la communauté open-source. Construit sur l'architecture propriétaire NEO-Unify, il modélise le langage, la sémantique visuelle et la génération de pixels dans un cadre unique, couvrant la compréhension visuelle, le raisonnement, la génération et l'édition. Malgré sa petite taille de paramètres de 8B-MoT, il peut gérer des instructions visuelles longues, multi-contraintes, hiérarchiques et structurées, ce qui le rend apte à créer des contenus à forte densité d'information comme des affiches et des infographies. Le modèle prend également en charge l'édition post-génération, y compris les images de référence, la composition multi-images et les modifications locales précises à l'aide de cadres rouges, de coordonnées et de marqueurs. Il a démontré sa capacité à reproduire et à adapter des cadres de conception, comme la transformation d'une infographie sur le thème du cinéma en un parcours de courrier postal, et à modifier des caractères individuels comme changer '迎' en '命' en réorganisant les éléments visuels. Le modèle peut également combiner plusieurs images de référence, transformant une photo réelle en recette dessinée à la main, ou un portrait en CV d'une page. SenseNova a réingénieré la tête de génération pour pousser la résolution native à 4K, réduisant les artefacts de grille et améliorant le détail des textures. Les performances se sont améliorées sur les benchmarks : le score Qwen-Image-Bench est passé de 47,14 à 55,20, ImgEdit-Bench de 3,90 à 4,37, et GEdit-Bench anglais de 7,47 à 8,17, chinois de 7,42 à 8,05, avec une moyenne globale WeEdit de 6,44. La version officielle de U1.5 devrait être open-sourcée bientôt. Des liens sont fournis sur GitHub, Hugging Face et ModelScope.
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches