Chinees Model SenseNova U1.5-Lite-Preview Nu Open Source met Native 4K Output
SenseTime
SenseTime heeft SenseNova U1.5-Lite-Preview gepreviewd en open-sourced, een lichtgewicht native uniform multimodaal model dat direct 4K-afbeeldingen kan genereren. Het ondersteunt complexe prompts, referentieafbeeldingen, compositie van meerdere afbeeldingen en nauwkeurige bewerking, wat een stap voorwaarts betekent in de mogelijkheden van AI-beeldgeneratie en -bewerking.
SenseTime heeft SenseNova U1.5-Lite-Preview, een vroege preview van een lichtgewicht native uniform multimodaal model, vrijgegeven aan de open-source gemeenschap. Gebouwd op het zelf ontwikkelde NEO-Unify-architectuur, modelleert het taal, visuele semantiek en pixelgeneratie binnen één enkel raamwerk, en dekt het visueel begrip, redenering, generatie en bewerking. Ondanks het kleine 8B-MoT parameterformaat, kan het lange, multi-constraint, hiërarchische en gestructureerde visuele instructies verwerken, waardoor het bedreven is in het creëren van inhoud met hoge informatiedichtheid zoals posters en infographics. Het model ondersteunt ook bewerking na generatie, waaronder referentieafbeeldingen, multi-image compositie en precieze lokale bewerkingen met behulp van rode kaders, coördinaten en markeringen. Het toonde het vermogen om ontwerpkaders te repliceren en aan te passen, zoals het omzetten van een film-gerelateerde infographic naar een postale reis, en om enkele karakters te wijzigen, zoals het veranderen van '迎' in '命' door visuele elementen te reorganiseren. Het model kan ook meerdere referentieafbeeldingen combineren, waardoor een echte foto wordt omgezet in een handgetekend recept, of een portret in een eenpagina CV. SenseNova heeft de generatiekop opnieuw ontworpen om de native resolutie naar 4K te duwen, waardoor rasterartefacten worden verminderd en textuurdetail wordt verbeterd. Prestaties verbeterden op benchmarks: Qwen-Image-Bench-score steeg van 47,14 naar 55,20, ImgEdit-Bench van 3,90 naar 4,37, en GEdit-Bench Engels van 7,47 naar 8,17, Chinees van 7,42 naar 8,05, met WeEdit Overall Average op 6,44. De officiële versie van U1.5 zal naar verwachting binnenkort open-source worden. Links worden verstrekt op GitHub, Hugging Face en ModelScope.
Bron: QbitAI 量子位 —
origineel
