미디어 생성 🇷🇺 02.08.2026 04:01

소셜 미디어 스티커 제작 자동화: 30개의 이미지로 SD 1.5용 스타일 LoRA 로컬 학습하기

Stability AIStability AI Google/DeepMindGoogle/DeepMind OpenAIOpenAI SalesforceSalesforce
한 매니아가 직접 선별한 30개의 VK 스티커를 사용하여 Stable Diffusion 1.5용 스타일 LoRA를 학습시키는 통제된 파이프라인을 구축했습니다. 목표는 일관된 스티커 팩 준비물을 만드는 것입니다. 사용자 지정 트리거 토큰 'vkstckrs'를 사용했고, Gemini 3.1 Pro와 ChatGPT 5.6이 생성한 AI 파이썬 스크립트로 배경 교체와 캡셔닝을 자동화했습니다.
저자는 스티커 팩용 일관된 일러스트를 프롬프트 엔지니어링만으로 생성하기가 어렵다는 문제에 직면했고, 그 해결책으로 Stable Diffusion 1.5(SD 1.5) 위에 스타일 LoRA를 학습시키기로 결정했다. SD 1.5는 복잡한 묘사를 이해하는 데 한계가 있음에도, 낮은 하드웨어 요구사항과 풍부한 생태계 덕분에 선택되었다. 데이터셋은 stickersvk.com에서 수동으로 선별한 30개의 스티커로 구성되었으며, 모델이 특정 캐릭터나 작가를 그대로 기억(memorize)하는 것을 방지하기 위해 팩당 하나의 스티커만 사용했다. 텍스트가 포함되거나 복잡한 자세를 취하거나 스타일이 크게 벗어난 이미지는 제외했다. 학습된 특징을 생성 시 활성화하기 위해 'vkstckrs'라는 트리거 토큰(trigger token)을 사용했다. Gemini 3.1 Pro는 투명 배경을 흰색으로 바꾸고 JPG로 저장하는 파이썬 스크립트를 작성했고, ChatGPT 5.6은 사전 학습된 이미지 캡셔닝 모델인 BLIP(Bootstrapping Language-Image Pre-training)을 이용해 캡션을 생성했다. 저자는 이 모델이 오직 교육 목적으로만 학습되었으며, 학습에 사용된 이미지는 학습 후 삭제했고 상업적 이용 의도는 전혀 없다는 점을 강조했다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스