PRX, Part 4: Our Data Strategy
Photoroom
The Photoroom team shared their data collection strategy for pre-training the PRX model: they use a mix of public and internal datasets, re-caption images with a VLM, and convert the final corpus into MDS format for streaming. The main focus is on diversity and breadth of coverage rather than perfectionism for each individual image. For data processing and labeling, they use the Lance columnar format, and for training, MDS (Mosaic Data Shards). Text encoding is done on the fly with Qwen3-VL, and images are stored in JPEG with quality 92, which does not degrade generation quality compared to PNG.
Компания Photoroom в четвёртой части серии статей о модели PRX описала свою стратегию подготовки данных для предобучения. Основной принцип — собрать большой и разнообразный набор данных, чтобы модель изучила широкий спектр визуальных концепций, а не только эстетически привлекательные изображения. Данные собираются из смеси публичных и внутренних источников; при этом авторы опираются на уже существующую курацию (фильтрацию качества, дедупликацию, удаление контента NSFW (Not Safe For Work) и персональной информации), чтобы не повторять эту работу с нуля. Все изображения повторно описываются с помощью VLM (Vision Language Model) для обеспечения единого стиля и длины подписей. Для построения и исследования набора данных используется колоночный формат Lance, поддерживающий полнотекстовый поиск и поиск по векторным эмбеддингам, что позволяет быстро профилировать данные и выявлять проблемы. Для обучения применяется формат MDS (Mosaic Data Shards), который хорошо подходит для распределённой тренировки и потоковой передачи данных из облачных хранилищ. Текстовые латенты вычисляются на лету с помощью энкодера Qwen3-VL, что добавляет лишь 3–4% к затратам на обучение, но избавляет от необходимости предварительно вычислять и хранить латенты. Изображения кодируются в JPEG с качеством 92; эксперименты показали, что это не оказывает заметного влияния на качество генерации по сравнению с PNG, при этом значительно экономя место. Также в статье приведены практические советы по работе с форматом Lance, в частности, по контролю фрагментации таблиц для ускорения запросов.
출처: Hugging Face blog —
원문
