PRX Bölüm 4: Veri Stratejimiz – Çeşitli Bir Ön Eğitim Külliyatı Oluşturmak
Photoroom
Photoroom'un PRX ekibi veri stratejilerini detaylandırıyor: herkese açık ve dahili kaynaklardan çeşitli bir ön eğitim veri seti oluşturmak, tüm görselleri bir VLM (Görsel Dil Modeli) ile yeniden altyazılandırmak ve verileri kürasyon için Lance'te, akış için MDS'de depolamak. Estetikten ziyade genişliği vurguluyor, JPEG kalitesi 92'yi kullanıyor ve Qwen3-VL ile metin gizli değişkenlerini anında hesaplıyorlar.
Photoroom'un PRX ekibi, 7B metin-görüntü modelini önceden eğitmek için veri stratejilerini paylaşıyor. Eğitim verilerini, kamuya açık ve dahili veri kümelerinin bir karışımından bir araya getiriyorlar; mükemmel per-görüntü kalitesi yerine çeşitlilik ve genişliğe öncelik veriyorlar. Tüm görüntüler, tutarlı ve uzun altyazılar için bir Görsel Dil Modeli (VLM) kullanılarak yeniden altyazılandırılıyor. Veriler, özellik mühendisliği ve keşif için Lance formatında saklanıyor, ardından dağıtık eğitim için Mosaic Data Shards (MDS) formatına dönüştürülüyor. Görüntüler, PNG'ye kıyasla ihmal edilebilir kalite kaybı gösteren 92 kalitesinde JPEG olarak kodlanıyor. Metin gizli değişkenleri eğitim sırasında Qwen3-VL kullanılarak anında hesaplanıyor ve yalnızca %3-4 verim maliyeti oluşturuyor. Ekip, tam metin arama ve vektör benzerliği kullanarak veri kümesine göz atmak için bir kullanıcı arayüzü (UI) oluşturdu; bu, niteliksel değerlendirme ve erken sorun tespitine olanak tanıyor.
Kaynak: Hugging Face blog —
orijinal
