PRX 第四部分:我们的数据策略
Photoroom
Photoroom 团队分享了用于预训练 PRX 模型的数据收集策略:他们混合使用公开数据集和内部数据集,使用视觉语言模型重新标注图像,并将最终语料库转换为 MDS 格式以实现流式传输。主要关注点是多样性和覆盖广度,而非对每张图像的完美主义。在数据处理和标注方面,他们使用 Lance 列式格式,训练则使用 MDS。文本编码使用 Qwen3-VL 实时进行,图像以 JPEG 格式存储,质量为 92,这相比 PNG 不会降低生成质量。
Photoroom公司PRX模型的开发者在系列文章的第四部分描述了他们的预训练数据准备策略。基本原则是收集一个庞大而多样化的数据集,使模型学习广泛的视觉概念,而不仅仅是美学上吸引人的图像。数据来自公开和内部来源的混合;作者利用已有的整理工作(质量过滤、去重、删除NSFW内容和个人信息),以避免从头开始重复这项工作。所有图像都通过视觉语言模型重新描述,以确保标题风格和长度统一。为了构建和探索数据集,使用了支持全文搜索和向量嵌入搜索的列式格式Lance,从而可以快速分析数据并发现潜在问题。训练时采用MDS格式,该格式非常适合分布式训练和从云存储进行流式数据传输。文本潜在表示通过Qwen3-VL编码器实时计算,仅增加3%–4%的训练成本,但省去了预先计算和存储潜在表示的需要。图像以JPEG格式编码,质量设为92;实验表明,与PNG相比,这对生成质量没有明显影响,同时显著节省存储空间。文章还提供了使用Lance格式的实用建议,特别是关于控制表碎片化以加速查询的方法。
来源: Hugging Face blog —
原文
