PRX، الجزء 4: استراتيجيتنا للبيانات
شارك فريق Photoroom استراتيجية جمع البيانات لتدريب نموذج PRX المسبق: يستخدمون مزيجًا من مجموعات البيانات العامة والداخلية، ويعيدون وصف الصور باستخدام نموذج رؤية-لغة (VLM)، ويحولون المجموعة النهائية إلى تنسيق MDS للبث. التركيز الرئيسي هو على التنوع واتساع التغطية بدلاً من الكمال لكل صورة فردية. لمعالجة البيانات وتسميتها، يستخدمون تنسيق Lance العمودي، وللتدريب، يستخدمون MDS (Mosaic Data Shards). يتم ترميز النص أثناء التشغيل باستخدام Qwen3-VL، ويتم تخزين الصور بتنسيق JPEG بجودة 92، مما لا يقلل من جودة التوليد مقارنةً بـ PNG.
Photoroom
Hugging Face blog27.07 · 08:03
