Model China SenseNova U1.5-Lite-Preview Dirilis Open Source dengan Output 4K Native
SenseTime
SenseTime telah mempratinjau dan merilis open source SenseNova U1.5-Lite-Preview, sebuah model multimodal terpadu native yang ringan yang dapat menghasilkan gambar 4K secara langsung. Model ini mendukung perintah kompleks, gambar referensi, komposisi multi-gambar, dan pengeditan presisi, menandai langkah maju dalam kemampuan generasi dan pengeditan gambar AI.
SenseTime merilis SenseNova U1.5-Lite-Preview, pratinjau awal dari model multimodal terpadu ringan native, kepada komunitas sumber terbuka. Dibangun di atas arsitektur NEO-Unify yang dikembangkan sendiri, model ini memodelkan bahasa, semantik visual, dan generasi piksel dalam satu kerangka kerja, mencakup pemahaman visual, penalaran, generasi, dan penyuntingan. Meskipun ukuran parameternya kecil 8B-MoT, model ini dapat menangani instruksi visual yang panjang, multi-kendala, hierarkis, dan terstruktur, sehingga mahir dalam membuat konten dengan kepadatan informasi tinggi seperti poster dan infografis. Model ini juga mendukung penyuntingan pasca-generasi, termasuk gambar referensi, komposisi multi-gambar, dan penyuntingan lokal yang presisi menggunakan kotak merah, koordinat, dan penanda. Model ini menunjukkan kemampuan untuk mereplikasi dan mengadaptasi kerangka desain, seperti mengubah infografis bertema film menjadi perjalanan pos, dan memodifikasi karakter tunggal seperti mengubah '迎' menjadi '命' dengan mengatur ulang elemen visual. Model ini juga dapat menggabungkan beberapa gambar referensi, mengubah foto nyata menjadi resep gambar tangan, atau potret menjadi resume satu halaman. SenseNova merekayasa ulang kepala generasi untuk mendorong resolusi native ke 4K, mengurangi artefak grid dan meningkatkan detail tekstur. Performa meningkat pada tolok ukur: skor Qwen-Image-Bench naik dari 47,14 menjadi 55,20, ImgEdit-Bench dari 3,90 menjadi 4,37, dan GEdit-Bench bahasa Inggris dari 7,47 menjadi 8,17, bahasa Mandarin dari 7,42 menjadi 8,05, dengan WeEdit Rata-rata Keseluruhan di 6,44. Versi resmi U1.5 diharapkan segera dirilis sebagai sumber terbuka. Tautan disediakan di GitHub, Hugging Face, dan ModelScope.
Sumber: QbitAI 量子位 —
asli
