RechercheModèles 🇺🇸 27.07.2026 08:03

PRX Partie 4 : Notre Stratégie de Données – Construire un Corpus de Pré-Entraînement Diversifié

PhotoroomPhotoroom
L'équipe PRX de Photoroom détaille leur stratégie de données : assembler un ensemble de données de pré-entraînement diversifié à partir de sources publiques et internes, re-légender toutes les images avec un VLM, et stocker les données dans Lance pour la curation et MDS pour le streaming. Ils mettent l'accent sur la diversité plutôt que sur l'esthétique, utilisent JPEG à la qualité 92, et calculent les latences textuelles à la volée avec Qwen3-VL.
L'équipe PRX de Photoroom partage sa stratégie de données pour le pré-entraînement d'un modèle texte-vers-image de 7 milliards de paramètres. Ils constituent les données d'entraînement à partir d'un mélange de jeux de données publics et internes, en privilégiant la diversité et l'étendue plutôt que la perfection individuelle de chaque image. Toutes les images sont re-légendées à l'aide d'un modèle vision-langage (VLM) pour obtenir des légendes longues et homogènes. Les données sont stockées au format Lance pour l'ingénierie des caractéristiques et l'exploration, puis converties en Mosaic Data Shards (MDS) pour l'entraînement distribué. Les images sont encodées en JPEG avec une qualité de 92, ce qui n'entraîne qu'une perte de qualité négligeable par rapport au PNG. Les vecteurs latents de texte sont calculés à la volée à l'aide de Qwen3-VL pendant l'entraînement, avec un surcoût de débit de seulement 3 à 4 %. L'équipe a développé une interface utilisateur pour parcourir le jeu de données grâce à la recherche en texte intégral et à la similarité vectorielle, permettant une évaluation qualitative et une détection précoce des problèmes.
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches