PRX 第 4 部分:我们的数据策略——构建多样化的预训练语料库
Photoroom
Photoroom 的 PRX 团队详细介绍了他们的数据策略:从公共和内部来源收集多样化的预训练数据集,使用视觉语言模型对所有图像重新生成描述,并将数据存储于 Lance 格式以便整理,以及 MDS 格式用于流式传输。他们强调广度而非美观,使用质量为 92 的 JPEG 格式,并利用 Qwen3-VL 实时计算文本潜变量。
Photoroom 的 PRX 团队分享了他们预训练 7B 文本到图像模型的数据策略。他们从公开和内部数据集混合收集训练数据,优先考虑多样性和广度而非单张图像的完美性。所有图像都使用视觉语言模型(VLM)重新生成描述,以获得一致的长描述。数据以 Lance 格式存储,用于特征工程和探索,随后转换为 Mosaic Data Shards(MDS)格式进行分布式训练。图像编码为 JPEG,质量设为 92,与 PNG 相比质量损失可忽略不计。文本潜在向量在训练期间使用 Qwen3-VL 动态计算,仅产生 3-4% 的吞吐量损失。团队构建了一个用户界面,通过全文搜索和向量相似性浏览数据集,从而实现定性评估和早期问题检测。
来源: Hugging Face blog —
原文
