PRX Parte 4: Nossa Estratégia de Dados – Construindo um Corpus de Pré-treinamento Diverso
Photoroom
A equipe PRX da Photoroom detalha sua estratégia de dados: montagem de um conjunto de dados diverso de pré-treinamento a partir de fontes públicas e internas, legendagem de todas as imagens com um VLM, e armazenamento de dados em Lance para curadoria e MDS para streaming. Eles enfatizam amplitude sobre estética, usam JPEG com qualidade 92 e calculam latentes de texto em tempo real com Qwen3-VL.
A equipe PRX da Photoroom compartilha sua estratégia de dados para pré-treinar um modelo de texto para imagem de 7 bilhões de parâmetros. Eles montam dados de treinamento a partir de uma combinação de conjuntos de dados públicos e internos, priorizando diversidade e amplitude em vez da perfeição individual de cada imagem. Todas as imagens são legendadas novamente usando um Modelo de Linguagem Visual (VLM, na sigla em inglês) para legendas consistentes e longas. Os dados são armazenados no formato Lance para engenharia de atributos e exploração, depois convertidos para Mosaic Data Shards (MDS) para treinamento distribuído. As imagens são codificadas como JPEG com qualidade 92, o que mostrou perda de qualidade insignificante em comparação com PNG. Os embeddings de texto são computados em tempo real usando o Qwen3-VL durante o treinamento, incorrendo em apenas um custo de 3-4% de rendimento. A equipe construiu uma interface para navegar pelo conjunto de dados usando busca de texto completo e similaridade vetorial, permitindo avaliação qualitativa e detecção precoce de problemas.
Fonte: Hugging Face blog —
original
