كيف أتممت إنشاء ملصقات وسائل التواصل الاجتماعي: تدريب محلي لنموذج LoRA للأنماط على SD 1.5 باستخدام 30 صورة
Stability AI
Google/DeepMind
OpenAI
Salesforce
بنى متحمس خط أنابيب متحكمًا به لتدريب نموذج LoRA للأنماط على Stable Diffusion 1.5 باستخدام 30 ملصق VK مختارًا يدويًا، بهدف إنشاء تحضيرات متسقة لحزم الملصقات. استخدموا رمز تشغيل مخصص 'vkstckrs' وقاموا بأتمتة استبدال الخلفية وإنشاء التسميات التوضيحية باستخدام نصوص برمجية مولدة بالذكاء الاصطناعي من Gemini 3.1 Pro و ChatGPT 5.6.
واجه المؤلف مشكلة في توليد رسوم توضيحية متسقة لمجموعات الملصقات باستخدام هندسة التلميحات، لذا قرر تدريب نموذج LoRA للنمط على Stable Diffusion 1.5. تم اختيار SD 1.5 نظراً لمتطلباته المنخفضة من العتاد ونظامه البيئي الواسع، على الرغم من قيوده في فهم الأوصاف المعقدة. تكونت مجموعة البيانات من 30 ملصقاً تم اختيارها يدوياً من stickersvk.com، مع ملصق واحد من كل مجموعة لتجنب تذكر النموذج لشخصيات أو مؤلفين محددين؛ كما تم استبعاد الصور التي تحتوي على نصوص أو أوضاع معقدة أو أنماط منحرفة. تم استخدام رمز تشغيل 'vkstckrs' لتفعيل الميزات المستفادة أثناء التوليد. كتب Gemini 3.1 Pro برنامجاً بلغة بايثون لاستبدال الخلفيات الشفافة بالأبيض وحفظها بصيغة JPG، بينما قام ChatGPT 5.6 بتوليد التسميات التوضيحية باستخدام BLIP، وهو نموذج جاهز لوصف الصور. وأكد المؤلف أن النموذج تم تدريبه للأغراض التعليمية فقط، وتم حذف الصور بعد التدريب، ولا يُقصد أي استخدام تجاري.
المصدر: Habr — хаб ИИ —
الأصلي
