الأبحاثالنماذج 🇷🇺 28.07.2026 08:02

كيف بنيت روبوتًا لمكافحة الاحتيال على بيانات غير نظيفة: كاشف ومصنف وتحديات على طول الطريق

OpenAIOpenAI
يصف المؤلف بناء روبوت لمكافحة الاحتيال في محادثات العملات الرقمية باستخدام مصنف لاكتشاف طلبات المساعدة ومصنف آخر لتحديد نوع المشكلة. تشمل الدروس الرئيسية استخدام التعلم النشط لتحسين مجموعة البيانات، وتجميد مجموعة ذهبية للحصول على مقاييس موثوقة، وتجنب التعقيد غير الضروري.
يتناول المشروع مشكلة المحتالين في غرف الدردشة الخاصة بالعملات المشفرة، الذين يقرؤون الرسائل العامة ثم يرسلون رسائل خاصة إلى المستخدمين طالبين المساعدة. يكتشف الروبوت طلبات المساعدة العامة ويستجيب بتحذير ورابط إلى الدعم الحقيقي. كان التحدي الأول هو بناء مصنف بدون مجموعة بيانات مصنفة. أدى جمع البيانات الأولي القائم على التعبيرات النمطية إلى الحد من قدرة النموذج على التعميم لعبارات غير مألوفة. تم استخدام التعلم النشط لإضافة أمثلة غير مؤكدة بشكل متكرر، مما زاد المجموعة الإيجابية من 830 إلى 1176. تم الاحتفاظ بالنسخ شبه المكررة لتحسين المتانة ضد الأخطاء الإملائية والعامية. تحول معيار التصنيف من "طلب مساعدة" إلى "مناسب للقاح" لتجنب التنشيط على الأسئلة البسيطة. أعطى التحقق المتقاطع على مجموعة بيانات متغيرة مقاييس مضللة؛ كشفت مجموعة ذهبية مجمدة من 245 رسالة عن تحسينات حقيقية، حيث ارتفعت نسبة الاستدعاء من 0.50 إلى 0.78. أظهر اختبار منفصل على حركة المرور الحقيقية دقة قابلة للضبط من 0.74 إلى 0.87 اعتمادًا على العتبة. تم الاحتفاظ بمصنف نوع المشكلة كانحدار لوجستي بسيط لتجنب التعقيد المفرط. يستخدم النظام نموذج تضمين متعدد اللغات واحدًا لكل من الكاشف وتوليد الاسترجاع المعزز، وهو حل وسط وفر الموارد ولكنه قد يحد من استدعاء التوليد المعزز. البنية عبارة عن خدمة FastAPI منفصلة مع SQLite، يستدعيها الروبوت الإنتاجي بطريقة إطلاق ونسيان، مع وضع ظل للاختبار الآمن.
المصدر: Habr — хаб ML — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة