Näin automatisoitin sosiaalisen median tarrojen luomisen: tyylin LoRA:n paikallinen koulutus SD 1.5:lle 30 kuvalla
Stability AI
Google/DeepMind
OpenAI
Salesforce
Innostunut harrastaja rakensi hallitun putkiston kouluttaakseen tyylin LoRA:n Stable Diffusion 1.5:lle käyttäen 30 käsin valittua VK-tarraa tavoitteenaan luoda yhtenäisiä tarrapakkausvalmisteluja. He käyttivät mukautettua laukaisutokenia 'vkstckrs' ja automatisoivat taustan korvaamisen ja kuvatekstien luomisen tekoälyn tuottamilla Python-skripteillä Gemini 3.1 Pro:sta ja ChatGPT 5.6:sta.
Kirjoittaja kohtasi ongelman, että johdonmukaisten kuvitusten tuottaminen tarrakokoelmille prompt-suunnittelun avulla on vaikeaa, joten he päättivät kouluttaa tyyli-LoRA:n Stable Diffusion 1.5:lle. SD 1.5 valittiin sen alhaisten laitteistovaatimusten ja laajan ekosysteemin vuoksi, huolimatta sen rajoituksista monimutkaisten kuvausten ymmärtämisessä. Tietoaineisto koostui 30 tarrasta, jotka valittiin manuaalisesti stickersvk.com-sivustolta, yksi tarra per pakkaus, jotta malli ei muistaisi tiettyjä hahmoja tai tekijöitä; kuvat, joissa oli tekstiä, monimutkaisia asentoja tai poikkeavia tyylejä, jätettiin pois. He käyttivät laukaisutokenia 'vkstckrs' aktivoidakseen opitut ominaisuudet generoinnin aikana. Gemini 3.1 Pro kirjoitti Python-skriptin, joka korvasi läpinäkyvät taustat valkoisella ja tallensi JPG-muodossa, kun taas ChatGPT 5.6 tuotti kuvatekstit käyttämällä BLIP:iä, joka on esikoulutettu kuvatekstitysmalli. Kirjoittaja korosti, että malli koulutettiin vain opetustarkoituksiin, kuvat poistettiin koulutuksen jälkeen, eikä kaupallista käyttöä ole tarkoitus.
Lähde: Habr — хаб ИИ —
Alkuperäinen
