и редактирование. Несмотря на компактный размер — 8B-MoT параметров (8 миллиардов параметров, архитектура Mixture of Transformers), модель способна обрабатывать длинные, многоограничительные, иерархические и структурированные визуальные инструкции, что делает её особенно эффективной для создания контента с высокой информационной плотностью, такого как постеры и инфографика. Модель также поддерживает редактирование после генерации, включая работу с референсными изображениями, композицию из нескольких изображений и точечное локальное редактирование с помощью красных рамок, координат и маркеров. Она продемонстрировала способность воспроизводить и адаптировать дизайнерские шаблоны — например, превращать инфографику на тему фильма в историю почтового путешествия письма — а также изменять отдельные иероглифы, например, превращать «迎» в «命» путём реорганизации визуальных элементов. Модель также может комбинировать несколько референсных изображений, превращая реальную фотографию в рукописный рецепт или портрет — в резюме на одной странице. SenseNova переработала генеративную головку модели, повысив нативное разрешение до 4K, что снизило количество артефактов сетки и улучшило детализацию текстур. Производительность улучшилась по нескольким тестовым показателям: результат на Qwen-Image-Bench вырос с 47,14 до 55,20, на ImgEdit-Bench — с 3,90 до 4,37, на GEdit-Bench (английский язык) — с 7,47 до 8,17, на китайском языке — с 7,42 до 8,05, а средний общий показатель WeEdit Overall Average составил 6,44. Ожидается, что официальная версия U1.5 будет открыта для сообщества в ближайшее время. Ссылки на проект доступны на GitHub, Hugging Face и ModelScope.