Mô hìnhSinh phương tiện 🇨🇳 03.08.2026 16:02

Mô hình Trung Quốc SenseNova U1.5-Lite-Preview mã nguồn mở với đầu ra 4K gốc

SenseTimeSenseTime
SenseTime đã công bố và mã nguồn mở SenseNova U1.5-Lite-Preview, một mô hình đa phương thức hợp nhất gốc nhẹ có thể tạo trực tiếp hình ảnh 4K. Mô hình này hỗ trợ các lời nhắc phức tạp, hình ảnh tham chiếu, kết hợp nhiều hình ảnh và chỉnh sửa chính xác, đánh dấu bước tiến trong khả năng tạo và chỉnh sửa hình ảnh bằng trí tuệ nhân tạo.
SenseTime đã phát hành SenseNova U1.5-Lite-Preview, một bản xem trước sớm của mô hình đa phương thức thống nhất (unified multimodal model) gốc, nhẹ, dành cho cộng đồng mã nguồn mở. Được xây dựng trên kiến trúc NEO-Unify do công ty tự phát triển, mô hình này mô hình hóa ngôn ngữ, ngữ nghĩa thị giác và quá trình sinh pixel trong một khung xử lý duy nhất, bao quát các khả năng hiểu, suy luận, sinh và chỉnh sửa hình ảnh. Dù chỉ có kích thước tham số nhỏ 8B-MoT (Mixture of Transformers - hỗn hợp các bộ biến đổi), mô hình vẫn có thể xử lý các chỉ dẫn thị giác dài, nhiều ràng buộc, phân cấp và có cấu trúc, giúp nó tạo ra hiệu quả các nội dung có mật độ thông tin cao như áp phích và đồ họa thông tin (infographic). Mô hình này còn hỗ trợ chỉnh sửa sau khi sinh ảnh, bao gồm sử dụng ảnh tham chiếu, kết hợp nhiều ảnh, và chỉnh sửa cục bộ chính xác bằng khung đỏ, tọa độ và các điểm đánh dấu. Nó đã thể hiện khả năng sao chép và điều chỉnh các khung thiết kế, chẳng hạn như chuyển đổi một đồ họa thông tin theo chủ đề phim ảnh thành hành trình gửi thư bưu điện, cũng như chỉnh sửa từng ký tự đơn lẻ, ví dụ đổi chữ "迎" thành "命" bằng cách tái tổ chức lại các yếu tố thị giác. Mô hình cũng có thể kết hợp nhiều ảnh tham chiếu, biến một bức ảnh thật thành công thức nấu ăn dạng vẽ tay, hoặc biến một bức ảnh chân dung thành bản sơ yếu lý lịch (resume) một trang. SenseNova đã tái thiết kế phần đầu sinh ảnh (generation head) để nâng độ phân giải gốc lên tới 4K, giảm hiện tượng lỗi lưới (grid artifacts) và cải thiện chi tiết chất liệu bề mặt (texture). Hiệu năng đã được cải thiện trên các bộ đánh giá chuẩn: điểm Qwen-Image-Bench tăng từ 47,14 lên 55,20; ImgEdit-Bench tăng từ 3,90 lên 4,37; GEdit-Bench tiếng Anh tăng từ 7,47 lên 8,17, tiếng Trung tăng từ 7,42 lên 8,05; và điểm trung bình tổng thể WeEdit đạt 6,44. Phiên bản chính thức của U1.5 dự kiến sẽ sớm được mã nguồn mở. Các đường liên kết được cung cấp trên GitHub, Hugging Face và ModelScope.
Nguồn: QbitAI 量子位 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới