الأبحاثالنماذج 🇺🇸 27.07.2026 08:03

PRX الجزء الرابع: استراتيجية البيانات لدينا – بناء مجموعة متنوعة من بيانات ما قبل التدريب

PhotoroomPhotoroom
فريق PRX في Photoroom يفصل استراتيجية البيانات الخاصة به: تجميع مجموعة متنوعة من بيانات ما قبل التدريب من مصادر عامة وداخلية، وإعادة تسمية جميع الصور باستخدام نموذج اللغة البصري VLM، وتخزين البيانات في Lance للتنظيم و MDS للتدفق. يؤكدون على الاتساع بدلاً من الجماليات، ويستخدمون JPEG بجودة 92، ويحسبون الأنساق النصية (latents) بشكل ديناميكي باستخدام Qwen3-VL.
يشارك فريق PRX في Photoroom استراتيجيته للبيانات من أجل التدريب المسبق لنموذج 7B لتوليد النص إلى صورة. يقوم الفريق بتجميع بيانات التدريب من مزيج من مجموعات البيانات العامة والداخلية، مع إعطاء الأولوية للتنوع والشمولية على الكمال لكل صورة على حدة. تتم إعادة وصف جميع الصور باستخدام نموذج رؤية ولغة (VLM) للحصول على وصفات طويلة متسقة. تُخزَّن البيانات بصيغة Lance لتسهيل هندسة الميزات والاستكشاف، ثم تُحوَّل إلى شرائح بيانات الفسيفساء (MDS) من أجل التدريب الموزع. تُرمَّز الصور بصيغة JPEG بجودة 92، مما أظهر فقدانًا ضئيلًا في الجودة مقارنة بصيغة PNG. تُحسب الخصائص الكامنة للنص أثناء التشغيل باستخدام Qwen3-VL أثناء التدريب، مما يتسبب في تكلفة إنتاجية تتراوح بين 3-4% فقط. قام الفريق ببناء واجهة مستخدم لتصفح مجموعة البيانات باستخدام البحث النصي الكامل والتشابه المتجهي، مما يتيح التقييم النوعي والكشف المبكر عن المشكلات.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة