Chinesisches Modell SenseNova U1.5-Lite-Preview als Open Source mit nativer 4K-Ausgabe veröffentlicht
SenseTime
SenseTime hat SenseNova U1.5-Lite-Preview, ein leichtgewichtiges nativ vereinheitlichtes multimodales Modell, vorgestellt und als Open Source veröffentlicht, das direkt 4K-Bilder erzeugen kann. Es unterstützt komplexe Eingabeaufforderungen, Referenzbilder, Mehrbildkomposition und präzise Bearbeitung und markiert einen Fortschritt in den Fähigkeiten der KI-Bilderzeugung und -bearbeitung.
SenseTime hat SenseNova U1.5-Lite-Preview veröffentlicht, eine frühe Vorschau eines leichten nativ einheitlichen multimodalen Modells, für die Open-Source-Community. Das Modell basiert auf der selbst entwickelten NEO-Unify-Architektur und modelliert Sprache, visuelle Semantik und Pixelgenerierung in einem einzigen Rahmenwerk, das visuelles Verständnis, Schlussfolgerung, Generierung und Bearbeitung abdeckt. Trotz seiner geringen Parameteranzahl von 8B-MoT kann es lange, mehrfach eingeschränkte, hierarchische und strukturierte visuelle Anweisungen verarbeiten und ist damit besonders geeignet, hochinformationsdichte Inhalte wie Poster und Infografiken zu erstellen. Das Modell unterstützt auch die Bearbeitung nach der Generierung, einschließlich Referenzbildern, Mehrbildkomposition und präziser lokaler Bearbeitung mit roten Kästchen, Koordinaten und Markierungen. Es demonstrierte die Fähigkeit, Designrahmen zu replizieren und anzupassen, beispielsweise die Umwandlung einer filmbezogenen Infografik in eine Postreise, und einzelne Zeichen zu modifizieren, wie die Änderung von „迎“ zu „命“ durch die Neuordnung visueller Elemente. Das Modell kann auch mehrere Referenzbilder kombinieren und ein echtes Foto in ein handgezeichnetes Rezept oder ein Porträt in einen einseitigen Lebenslauf verwandeln. SenseNova hat den Generierungskopf neu gestaltet, um die native Auflösung auf 4K zu erhöhen, Gitterartefakte zu reduzieren und die Texturdetails zu verbessern. Die Leistung verbesserte sich bei Benchmarks: Der Qwen-Image-Bench-Score stieg von 47,14 auf 55,20, ImgEdit-Bench von 3,90 auf 4,37 und GEdit-Bench Englisch von 7,47 auf 8,17, Chinesisch von 7,42 auf 8,05, mit einem WeEdit-Gesamtdurchschnitt von 6,44. Die offizielle Version von U1.5 soll bald als Open Source veröffentlicht werden. Links sind auf GitHub, Hugging Face und ModelScope verfügbar.
Quelle: QbitAI 量子位 —
Original
