InvestigaciónModelos 🇺🇸 27.07.2026 08:03

PRX Parte 4: Nuestra Estrategia de Datos – Construyendo un Corpus de Preentrenamiento Diverso

PhotoroomPhotoroom
El equipo PRX de Photoroom detalla su estrategia de datos: ensamblar un conjunto de datos de preentrenamiento diverso a partir de fuentes públicas e internas, reetiquetar todas las imágenes con un VLM y almacenar los datos en Lance para curación y MDS para transmisión. Enfatizan la amplitud sobre la estética, usan JPEG con calidad 92 y calculan los latentes de texto sobre la marcha con Qwen3-VL.
El equipo PRX de Photoroom comparte su estrategia de datos para preentrenar un modelo de texto a imagen de 7 mil millones de parámetros. Ensamblan los datos de entrenamiento a partir de una combinación de conjuntos de datos públicos e internos, priorizando la diversidad y amplitud sobre la perfección individual de cada imagen. Todas las imágenes se vuelven a etiquetar utilizando un modelo de lenguaje visual (VLM, por sus siglas en inglés) para obtener descripciones extensas y consistentes. Los datos se almacenan en formato Lance para ingeniería de características y exploración, y luego se convierten a Mosaic Data Shards (MDS) para el entrenamiento distribuido. Las imágenes se codifican como JPEG con calidad 92, lo que mostró una pérdida de calidad insignificante en comparación con PNG. Los latentes de texto se calculan sobre la marcha utilizando Qwen3-VL durante el entrenamiento, con un costo de solo 3-4% en el rendimiento. El equipo creó una interfaz de usuario para explorar el conjunto de datos mediante búsqueda de texto completo y similitud vectorial, lo que permite una evaluación cualitativa y la detección temprana de problemas.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas