Sinh phương tiện 🇷🇺 02.08.2026 04:01

Cách tôi tự động hóa việc tạo nhãn dán mạng xã hội: Huấn luyện cục bộ LoRA phong cách cho SD 1.5 trên 30 hình ảnh

Stability AIStability AI Google/DeepMindGoogle/DeepMind OpenAIOpenAI SalesforceSalesforce
Một người đam mê đã xây dựng một quy trình có kiểm soát để huấn luyện LoRA phong cách trên Stable Diffusion 1.5 với 30 nhãn dán VK được chọn lọc kỹ lưỡng, nhằm tạo ra các bộ nhãn dán nhất quán. Họ sử dụng mã kích hoạt tùy chỉnh 'vkstckrs' và tự động hóa việc thay thế nền cũng như ghi chú bằng các kịch bản Python do AI tạo từ Gemini 3.1 Pro và ChatGPT 5.6.
Tác giả gặp phải vấn đề khi tạo ra các hình minh họa nhất quán cho các bộ nhãn dán bằng kỹ thuật prompt engineering, vì vậy họ quyết định huấn luyện một LoRA về phong cách trên Stable Diffusion 1.5. SD 1.5 được chọn vì yêu cầu phần cứng thấp và hệ sinh thái rộng lớn, mặc dù có hạn chế trong việc hiểu các mô tả phức tạp. Bộ dữ liệu bao gồm 30 nhãn dán được chọn thủ công từ stickersvk.com, mỗi bộ chỉ lấy một nhãn dán để tránh mô hình ghi nhớ các nhân vật hoặc tác giả cụ thể; các hình ảnh có chữ, tư thế phức tạp hoặc phong cách lệch lạc đều bị loại. Họ sử dụng một token kích hoạt 'vkstckrs' để kích hoạt các đặc trưng đã học trong quá trình tạo. Gemini 3.1 Pro đã viết một tập lệnh Python để thay thế nền trong suốt bằng màu trắng và lưu dưới dạng JPG, trong khi ChatGPT 5.6 đã tạo ra các chú thích bằng BLIP, một mô hình chú thích hình ảnh được huấn luyện trước. Tác giả nhấn mạnh rằng mô hình chỉ được huấn luyện cho mục đích giáo dục, các hình ảnh đã bị xóa sau khi huấn luyện và không có ý định sử dụng thương mại.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới