Çin Modeli SenseNova U1.5-Lite-Preview, Yerli 4K Çıktı ile Açık Kaynak Oldu
SenseTime
SenseTime, doğrudan 4K görüntü üretebilen hafif, yerli birleşik çok modlu model olan SenseNova U1.5-Lite-Preview'ı önizledi ve açık kaynak yaptı. Karmaşık istemleri, referans görüntülerini, çoklu görüntü kompozisyonunu ve hassas düzenlemeyi destekleyen model, yapay zeka görüntü üretimi ve düzenleme yeteneklerinde ileri bir adımı işaret ediyor.
SenseTime, hafif ve yerel birleşik çok modlu modelin erken önizlemesi olan SenseNova U1.5-Lite-Preview'ı açık kaynak topluluğuna sundu. Kendi geliştirdiği NEO-Unify mimarisi üzerine inşa edilen model, dil, görsel anlambilim ve piksel üretimini tek bir çerçevede modeller; görsel anlama, akıl yürütme, üretim ve düzenlemeyi kapsar. Küçük 8B-MoT parametre boyutuna rağmen, uzun, çok kısıtlı, hiyerarşik ve yapılandırılmış görsel talimatları işleyebilir; bu da onu posterler ve infografikler gibi yüksek bilgi yoğunluklu içerikler oluşturmada usta kılar. Model ayrıca referans görseller, çoklu görsel kompozisyonu ve kırmızı kutular, koordinatlar ve işaretleyiciler kullanarak hassas yerel düzenlemeler dahil olmak üzere üretim sonrası düzenlemeyi destekler. Film temalı bir infografiği posta yolculuğuna dönüştürmek gibi tasarım çerçevelerini kopyalama ve uyarlama yeteneğini ve görsel öğeleri yeniden düzenleyerek '迎'yi '命'ye değiştirmek gibi tek karakterleri değiştirme yeteneğini gösterdi. Model ayrıca birden fazla referans görseli birleştirerek gerçek bir fotoğrafı elle çizilmiş bir tarife veya bir portreyi tek sayfalık bir özgeçmişe dönüştürebilir. SenseNova, yerel çözünürlüğü 4K'ya yükseltmek için üretim başlığını yeniden tasarladı; böylece ızgara yapıları azaldı ve doku detayı iyileşti. Performans kıyaslamalarda iyileşti: Qwen-Image-Bench puanı 47.14'ten 55.20'ye, ImgEdit-Bench 3.90'dan 4.37'ye ve GEdit-Bench İngilizce 7.47'den 8.17'ye, Çince 7.42'den 8.05'e yükselirken, WeEdit Genel Ortalama 6.44 oldu. U1.5'in resmi sürümünün yakında açık kaynak olarak sunulması bekleniyor. Bağlantılar GitHub, Hugging Face ve ModelScope'da sağlanmıştır.
Kaynak: QbitAI 量子位 —
orijinal
