PRX osa 4: Tietostrategiamme – monipuolisen esikoulutusaineiston rakentaminen
Photoroom
Photoroom:n PRX-tiimi kertoo tietostrategiastaan: kokoamme monipuolisen esikoulutusaineiston julkisista ja sisäisistä lähteistä, uudelleenotsikoimme kaikki kuvat VLM:llä, ja tallennamme datan Lanceen kuratointia ja MDS:ää varten suoratoistoa varten. He korostavat laajuutta estetiikan sijaan, käyttävät JPEG:tä laadulla 92, ja laskevat teksti-latentteja lennossa Qwen3-VL:llä.
Photoroom:n PRX-tiimi jakaa datastrategiansa 7B tekstistä kuvaksi -mallin esikoulutusta varten. He kokoavat harjoitusdataa julkisten ja sisäisten tietoaineistojen yhdistelmästä, priorisoiden monimuotoisuutta ja laajuutta yksittäisen kuvan täydellisyyden sijaan. Kaikki kuvat kuvatekstitetään uudelleen visuaalisella kielimallilla (VLM) yhtenäisten, pitkien kuvatekstien saamiseksi. Data tallennetaan Lance-muotossa piirteiden muokkausta ja tutkimista varten, minkä jälkeen se muunnetaan Mosaic Data Shards (MDS) -muotoon hajautettua harjoittelua varten. Kuvat koodataan JPEG-muotoon laatutasolla 92, mikä aiheutti vähäpätöisen laadun heikkenemisen PNG-muotoon verrattuna. Tekstilatentteja lasketaan lennossa Qwen3-VL:n avulla harjoittelun aikana, aiheuttaen vain 3-4 prosentin suorituskykytappion. Tiimi rakensi käyttöliittymän, jolla aineistoa voidaan selata kokotekstihaun ja vektorisamankaltaisuuden avulla, mahdollistaen laadullisen arvioinnin ja varhaisen ongelmien havaitsemisen.
Lähde: Hugging Face blog —
Alkuperäinen
