OnderzoekModellen 🇺🇸 27.07.2026 08:03

PRX, Deel 4: Onze Datastrategie

PhotoroomPhotoroom
Het Photoroom-team deelde hun strategie voor het verzamelen van data voor het vooraf trainen van het PRX-model: ze gebruiken een mix van openbare en interne datasets, herschrijven afbeeldingen met een VLM, en zetten het uiteindelijke corpus om naar MDS-formaat voor streaming. De focus ligt op diversiteit en brede dekking in plaats van perfectionisme voor elke individuele afbeelding. Voor gegevensverwerking en labeling gebruiken ze het Lance-kolomformaat, en voor training MDS (Mosaic Data Shards). Tekstcodering gebeurt on-the-fly met Qwen3-VL, en afbeeldingen worden opgeslagen in JPEG met kwaliteit 92, wat de generatiekwaliteit niet vermindert in vergelijking met PNG.
Ontwikkelaars van het model PRX van het bedrijf Photoroom beschreven in het vierde deel van een artikelenreeks hun strategie voor het voorbereiden van data voor pretraining. Het basisprincipe is om een grote en diverse dataset te verzamelen, zodat het model een breed scala aan visuele concepten leert, niet alleen esthetisch aantrekkelijke afbeeldingen. De data worden verzameld uit een mix van openbare en interne bronnen; daarbij vertrouwen de auteurs op bestaande curatie (kwaliteitsfiltering, deduplicatie, verwijdering van NSFW-content en persoonlijke informatie) om dit werk niet opnieuw te hoeven doen. Alle afbeeldingen worden opnieuw beschreven met behulp van een VLM (Vision Language Model) om een uniforme stijl en lengte van de bijschriften te garanderen. Voor het bouwen en onderzoeken van de dataset wordt het kolomgeoriënteerde formaat Lance gebruikt, dat ondersteuning biedt voor full-text search en zoeken op vector-embeddings, waardoor data snel kunnen worden geprofileerd en problemen kunnen worden opgespoord. Voor de training wordt het MDS-formaat (Mosaic Data Shards) gebruikt, dat goed geschikt is voor gedistribueerde training en het streamen van data uit cloudopslag. Tekst-latenten worden on-the-fly berekend met behulp van de encoder Qwen3-VL, wat slechts 3-4% extra kosten voor training met zich meebrengt, maar de noodzaak om latenten vooraf te berekenen en op te slaan elimineert. Afbeeldingen worden gecodeerd in JPEG met kwaliteit 92; experimenten toonden aan dat dit geen merkbare invloed heeft op de generatiekwaliteit in vergelijking met PNG, terwijl het aanzienlijk ruimte bespaart. Ook worden in het artikel praktische tips gegeven voor het werken met het Lance-formaat, met name voor het beheersen van fragmentatie van tabellen om query's te versnellen.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws