مفتوح المصدرالأبحاث 🇷🇺 13.08.2026 13:03

علماء روس يبتكرون أداة للتحقق من البيانات قبل تدريب نماذج الذكاء الاصطناعي

СберСбер СбербанкСбербанк
قدم علماء من مركز سبيربنك للذكاء الاصطناعي العملي ومعهد AIRI أداة SplitLight مفتوحة المصدر لتشخيص البيانات قبل التدريب ومقارنة نماذج التوصية. تكتشف الأداة الحالات الشاذة، وتضمن قابلية مقارنة النتائج، وتتحقق من الواقعية، مما يقلل من خطر نشر نماذج غير فعالة.
قدم علماء من مركز سيربنك للذكاء الاصطناعي التطبيقي ومعهد AIRI أداة SplitLight مفتوحة المصدر لتشخيص البيانات قبل التدريب ومقارنة نماذج التوصية. تُستخدم أنظمة التوصية على نطاق واسع في التجارة الإلكترونية وخدمات الفيديو ومنصات المحتوى، وتعتمد الشركات على التجارب لاتخاذ قرار بشأن النماذج التي يجب تطويرها. ومع ذلك، إذا كانت بيانات التدريب مُعدة بشكل سيئ أو انحرفت الظروف التجريبية عن الواقع، فقد تختار الفرق حلولاً غير مناسبة وتهدر الموارد. تقلل SplitLight من هذه المخاطر من خلال السماح بإجراء فحوصات مبكرة للبيانات وتقييم قابلية التطبيق العملي للنتائج التجريبية. وهي متاحة مجاناً ويمكن استخدامها كمكتبة بايثون أو كواجهة ويب تفاعلية. الهدف الرئيسي للأداة هو جعل المشكلات غير المرئية مرئية، مثل فشل التسجيل وتحولات الطوابع الزمنية والأحداث المكررة التي قد تشوه المقاييس. كما تعالج مشكلة عدم قابلية المقارنة بين الدراسات، مما يمكن الفرق من تثبيت الإحصائيات الرئيسية لإمكانية إعادة الإنتاج. بالإضافة إلى ذلك، تتحقق من الواقعية من خلال تحديد تسرب البيانات من المستقبل، ومراعاة المستخدمين والعناصر الجديدة، وتقييم الاختلافات بين مجموعات التدريب والتحقق. اختبر فريق المشروع، بقيادة أليكسي فاسيليف، SplitLight على ست مجموعات بيانات مفتوحة شائعة، مما أظهر أنه حتى التغييرات الطفيفة في التقسيم يمكن أن تؤثر بشكل كبير على المقاييس. أشار سيرجي ريابوف، المدير الإداري الأول ومدير التحول في الذكاء الاصطناعي في سيربنك، إلى أن SplitLight توفر حماية موثوقة لفرق المنتجات في الأسواق والبث ووسائل الإعلام، وتبسط التوثيق والمقارنة للمجموعات البحثية. الكود المصدري متاح على المنصة الروسية GitVerse وعلى GitHub.
المصدر: CNews — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة