मीडिया निर्माण 🇷🇺 02.08.2026 04:01

मैंने सोशल मीडिया स्टिकर निर्माण कैसे स्वचालित किया: SD 1.5 के लिए 30 छवियों पर लोकल स्टाइल LoRA प्रशिक्षण

Stability AIStability AI Google/DeepMindGoogle/DeepMind OpenAIOpenAI SalesforceSalesforce
एक उत्साही ने 30 चुनिंदा VK स्टिकर पर Stable Diffusion 1.5 के लिए स्टाइल LoRA प्रशिक्षित करने हेतु एक नियंत्रित पाइपलाइन बनाई, जिसका उद्देश्य सुसंगत स्टिकर पैक तैयार करना था। उन्होंने कस्टम ट्रिगर टोकन 'vkstckrs' का उपयोग किया और Gemini 3.1 Pro तथा ChatGPT 5.6 से AI-जनरेटेड Python स्क्रिप्ट द्वारा पृष्ठभूमि प्रतिस्थापन और कैप्शनिंग को स्वचालित किया।
लेखक को स्टिकर पैक के लिए सुसंगत चित्र बनाने में प्रॉम्प्ट इंजीनियरिंग की सीमाओं का सामना करना पड़ा, इसलिए उन्होंने स्टेबल डिफ्यूजन 1.5 पर एक स्टाइल LoRA प्रशिक्षित करने का निर्णय लिया। SD 1.5 को इसकी कम हार्डवेयर आवश्यकताओं और व्यापक पारिस्थितिकी तंत्र के कारण चुना गया, भले ही जटिल विवरणों को समझने में इसकी सीमाएँ हों। डेटासेट में stickersvk.com से मैन्युअल रूप से चुने गए 30 स्टिकर शामिल थे, जिनमें प्रत्येक पैक से एक स्टिकर रखा गया ताकि मॉडल विशिष्ट पात्रों या लेखकों को याद न कर सके; पाठ, जटिल मुद्रा, या भिन्न शैली वाली छवियों को बाहर रखा गया। प्रशिक्षण के दौरान सीखी गई विशेषताओं को सक्रिय करने के लिए उन्होंने एक ट्रिगर टोकन 'vkstckrs' का उपयोग किया। जेमिनी 3.1 प्रो ने पारदर्शी पृष्ठभूमि को सफेद से बदलकर JPG के रूप में सहेजने के लिए एक पायथन स्क्रिप्ट लिखी, जबकि चैटजीपीटी 5.6 ने BLIP, एक पूर्व-प्रशिक्षित छवि कैप्शनिंग मॉडल, का उपयोग करके कैप्शन उत्पन्न किए। लेखक ने जोर दिया कि मॉडल केवल शैक्षिक उद्देश्यों के लिए प्रशिक्षित किया गया था, प्रशिक्षण के बाद छवियों को हटा दिया गया था, और कोई व्यावसायिक उपयोग का इरादा नहीं है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार