OnderzoekModellen 🇺🇸 27.07.2026 08:03

PRX Deel 4: Onze Datastrategie – Het Opbouwen van een Divers Pre-training Corpus

PhotoroomPhotoroom
Het PRX-team van Photoroom beschrijft hun datastrategie: het samenstellen van een diverse pre-training dataset uit publieke en interne bronnen, het her-bijschrijven van alle afbeeldingen met een VLM, en het opslaan van data in Lance voor curatie en MDS voor streaming. Ze benadrukken breedte boven esthetiek, gebruiken JPEG met kwaliteit 92, en berekenen tekst-latents on-the-fly met Qwen3-VL.
Het PRX-team van Photoroom deelt hun datastrategie voor het vooraf trainen van een 7B text-to-image-model. Ze stellen trainingsdata samen uit een mix van openbare en interne datasets, waarbij diversiteit en breedte prioriteit krijgen boven perfectie per beeld. Alle afbeeldingen worden opnieuw van bijschriften voorzien met behulp van een visueel taalmodel (VLM) voor consistente, lange bijschriften. De data wordt opgeslagen in Lance-formaat voor feature engineering en verkenning, en vervolgens omgezet naar Mosaic Data Shards (MDS) voor gedistribueerde training. Afbeeldingen worden gecodeerd als JPEG met kwaliteit 92, wat een verwaarloosbaar kwaliteitsverlies liet zien vergeleken met PNG. Tekst-latenten worden tijdens de training on-the-fly berekend met Qwen3-VL, wat slechts een doorvoerkostenpost van 3-4% met zich meebrengt. Het team bouwde een gebruikersinterface om de dataset te doorzoeken met behulp van full-text search en vector-similariteit, wat kwalitatieve beoordeling en vroege foutdetectie mogelijk maakt.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws