ModelosGeração de Mídia 🇨🇳 03.08.2026 16:02

Modelo Chinês SenseNova U1.5-Lite-Preview é Lançado como Open Source com Saída Nativa em 4K

SenseTimeSenseTime
A SenseTime disponibilizou em pré-visualização e como código aberto o SenseNova U1.5-Lite-Preview, um modelo multimodal unificado e leve que pode gerar imagens em 4K diretamente. Ele suporta prompts complexos, imagens de referência, composição com múltiplas imagens e edição precisa, representando um avanço nas capacidades de geração e edição de imagens por IA.
A SenseTime lançou o SenseNova U1.5-Lite-Preview, uma prévia inicial de um modelo multimodal unificado nativo e leve, para a comunidade de código aberto. Construído sobre a arquitetura própria NEO-Unify, ele modela linguagem, semântica visual e geração de pixels em um único framework, cobrindo compreensão visual, raciocínio, geração e edição. Apesar do tamanho compacto de 8B-MoT, ele pode lidar com instruções visuais longas, com múltiplas restrições, hierárquicas e estruturadas, sendo hábil na criação de conteúdo com alta densidade de informação, como pôsteres e infográficos. O modelo também suporta edição pós-geração, incluindo imagens de referência, composição de múltiplas imagens e edições locais precisas usando caixas vermelhas, coordenadas e marcadores. Ele demonstrou a capacidade de replicar e adaptar frameworks de design, como converter um infográfico com tema de filme em um percurso de correspondência postal, e de modificar caracteres individuais, como mudar '迎' para '命', reorganizando elementos visuais. O modelo também pode combinar múltiplas imagens de referência, transformando uma foto real em uma receita desenhada à mão, ou um retrato em um currículo de uma página. A SenseNova reengenhou a cabeça de geração para elevar a resolução nativa para 4K, reduzindo artefatos de grade e melhorando o detalhe de textura. O desempenho melhorou nos benchmarks: a pontuação no Qwen-Image-Bench subiu de 47,14 para 55,20, no ImgEdit-Bench de 3,90 para 4,37, e no GEdit-Bench Inglês de 7,47 para 8,17, Chinês de 7,42 para 8,05, com WeEdit Overall Average em 6,44. A versão oficial do U1.5 deve ser disponibilizada em código aberto em breve. Os links estão disponíveis no GitHub, Hugging Face e ModelScope.
Fonte: QbitAI 量子位 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas