मैंने सोशल मीडिया स्टिकर निर्माण कैसे स्वचालित किया: SD 1.5 के लिए 30 छवियों पर लोकल स्टाइल LoRA प्रशिक्षण
Stability AI
Google/DeepMind
OpenAI
Salesforce
एक उत्साही ने 30 चुनिंदा VK स्टिकर पर Stable Diffusion 1.5 के लिए स्टाइल LoRA प्रशिक्षित करने हेतु एक नियंत्रित पाइपलाइन बनाई, जिसका उद्देश्य सुसंगत स्टिकर पैक तैयार करना था। उन्होंने कस्टम ट्रिगर टोकन 'vkstckrs' का उपयोग किया और Gemini 3.1 Pro तथा ChatGPT 5.6 से AI-जनरेटेड Python स्क्रिप्ट द्वारा पृष्ठभूमि प्रतिस्थापन और कैप्शनिंग को स्वचालित किया।
लेखक को स्टिकर पैक के लिए सुसंगत चित्र बनाने में प्रॉम्प्ट इंजीनियरिंग की सीमाओं का सामना करना पड़ा, इसलिए उन्होंने स्टेबल डिफ्यूजन 1.5 पर एक स्टाइल LoRA प्रशिक्षित करने का निर्णय लिया। SD 1.5 को इसकी कम हार्डवेयर आवश्यकताओं और व्यापक पारिस्थितिकी तंत्र के कारण चुना गया, भले ही जटिल विवरणों को समझने में इसकी सीमाएँ हों। डेटासेट में stickersvk.com से मैन्युअल रूप से चुने गए 30 स्टिकर शामिल थे, जिनमें प्रत्येक पैक से एक स्टिकर रखा गया ताकि मॉडल विशिष्ट पात्रों या लेखकों को याद न कर सके; पाठ, जटिल मुद्रा, या भिन्न शैली वाली छवियों को बाहर रखा गया। प्रशिक्षण के दौरान सीखी गई विशेषताओं को सक्रिय करने के लिए उन्होंने एक ट्रिगर टोकन 'vkstckrs' का उपयोग किया। जेमिनी 3.1 प्रो ने पारदर्शी पृष्ठभूमि को सफेद से बदलकर JPG के रूप में सहेजने के लिए एक पायथन स्क्रिप्ट लिखी, जबकि चैटजीपीटी 5.6 ने BLIP, एक पूर्व-प्रशिक्षित छवि कैप्शनिंग मॉडल, का उपयोग करके कैप्शन उत्पन्न किए। लेखक ने जोर दिया कि मॉडल केवल शैक्षिक उद्देश्यों के लिए प्रशिक्षित किया गया था, प्रशिक्षण के बाद छवियों को हटा दिया गया था, और कोई व्यावसायिक उपयोग का इरादा नहीं है।
स्रोत: Habr — хаб ИИ —
मूल
