PRX Bagian 4: Strategi Data Kami – Membangun Korpus Pra-pelatihan yang Beragam
Photoroom
Tim PRX Photoroom merinci strategi data mereka: merakit dataset pra-pelatihan yang beragam dari sumber publik dan internal, memberi keterangan ulang semua gambar dengan VLM, dan menyimpan data di Lance untuk kurasi serta MDS untuk streaming. Mereka menekankan keluasan di atas estetika, menggunakan JPEG pada kualitas 92, dan menghitung latens teks secara langsung dengan Qwen3-VL.
Tim PRX Photoroom membagikan strategi data mereka untuk pra-pelatihan model teks-ke-gambar 7B. Mereka menyusun data pelatihan dari campuran kumpulan data publik dan internal, memprioritaskan keragaman dan cakupan daripada kesempurnaan per gambar. Semua gambar diberi keterangan ulang menggunakan VLM untuk menghasilkan keterangan panjang yang konsisten. Data disimpan dalam format Lance untuk rekayasa fitur dan eksplorasi, kemudian dikonversi ke Mosaic Data Shards (MDS) untuk pelatihan terdistribusi. Gambar dienkode sebagai JPEG dengan kualitas 92, yang menunjukkan penurunan kualitas yang dapat diabaikan dibandingkan dengan PNG. Lateks teks dihitung secara langsung menggunakan Qwen3-VL selama pelatihan, hanya memerlukan biaya throughput sebesar 3-4%. Tim membangun antarmuka pengguna (UI) untuk menjelajahi kumpulan data menggunakan pencarian teks lengkap dan kemiripan vektor, yang memungkinkan penilaian kualitatif dan deteksi dini masalah.
Sumber: Hugging Face blog —
asli
