शोधमॉडल 🇺🇸 27.07.2026 08:03

PRX भाग 4: हमारी डेटा रणनीति – विविध पूर्व-प्रशिक्षण कॉर्पस का निर्माण

PhotoroomPhotoroom
Photoroom की PRX टीम अपनी डेटा रणनीति का विवरण देती है: सार्वजनिक और आंतरिक स्रोतों से एक विविध पूर्व-प्रशिक्षण डेटासेट तैयार करना, सभी छवियों को विज़ुअल लैंग्वेज मॉडल (VLM) के साथ पुनः कैप्शन देना, और डेटा को क्यूरेशन के लिए Lance फॉर्मेट और स्ट्रीमिंग के लिए MDS फॉर्मेट में संग्रहित करना। वे सौंदर्यशास्त्र की तुलना में विविधता पर अधिक जोर देते हैं, गुणवत्ता 92 पर JPEG का उपयोग करते हैं, और Qwen3-VL के साथ फ्लाई पर टेक्स्ट लेटेंट्स की गणना करते हैं।
Photoroom की PRX टीम 7B टेक्स्ट-टू-इमेज मॉडल के प्री-ट्रेनिंग के लिए अपनी डेटा रणनीति साझा करती है। वे सार्वजनिक और आंतरिक डेटासेट के मिश्रण से प्रशिक्षण डेटा तैयार करते हैं, जिसमें प्रति-छवि पूर्णता से अधिक विविधता और व्यापकता को प्राथमिकता दी जाती है। सभी छवियों को एक वीएलएम (VLM) का उपयोग करके पुनः कैप्शन दिया जाता है, ताकि सुसंगत, लंबे कैप्शन प्राप्त हों। फीचर इंजीनियरिंग और अन्वेषण के लिए डेटा को लांस (Lance) फॉर्मेट में संग्रहीत किया जाता है, फिर वितरित प्रशिक्षण के लिए मोज़ेक डेटा शार्ड्स (MDS) में परिवर्तित किया जाता है। छवियों को क्वालिटी 92 पर जेपीईजी (JPEG) के रूप में एन्कोड किया जाता है, जिसमें पीएनजी (PNG) की तुलना में नगण्य गुणवत्ता हानि होती है। टेक्स्ट लेटेंट्स की गणना प्रशिक्षण के दौरान ऑन द फ्लाई (on the fly) Qwen3-VL का उपयोग करके की जाती है, जिसमें केवल 3-4% थ्रूपुट लागत आती है। टीम ने पूर्ण-पाठ खोज और वेक्टर समानता का उपयोग करके डेटासेट ब्राउज़ करने के लिए एक यूआई (UI) बनाया, जो गुणात्मक मूल्यांकन और प्रारंभिक समस्या का पता लगाने में सक्षम बनाता है।
स्रोत: Hugging Face blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार