كيف وصفنا 15000 جدول في ستة أشهر بدلاً من 500 في السنة – وتوقفنا عن كتابة التوثيق يدويًا
Яндекс
قامت ياندكس بأتمتة توثيق الجداول باستخدام روبوت يعمل بنموذج لغة كبير يجمع البيانات الوصفية من مصادر مختلفة ويولد مسودات الأوصاف. في ستة أشهر، تم وصف 15000 جدول بدلاً من 500 في السنة مع العمل اليدوي، مما وفر حوالي خمس سنوات من وقت المحللين.
واجهت Yandex تحديًا ضخمًا في توثيق البيانات: من بين 40,000 جدول مصفى، تمت كتابة 500 وصف يدويًا فقط في عام واحد. قام رومان غريدنيف، مدير تقني، ببناء روبوت بلغة Python يستخدم نماذج اللغة الكبيرة (LLMs) ومصادر البيانات الداخلية (مسارات البيانات، المخططات، بيانات العينات، قواميس Wiki، الجيران في الرسم البياني من Memgraph، الجيران في المجلدات) لتوليد مسودات الوصف. يجمع الروبوت أولاً البيانات الموضوعية، ثم يرسلها إلى نموذج اللغة الكبير (LLM) لإنتاج عنوان ووصف، متجنبًا ورقة فارغة. يتم تحميل الأوصاف في كتالوج البيانات، حيث يمكن للبشر مراجعتها. في غضون ستة أشهر، تم وصف 15,000 جدول، مما وفر حوالي خمس سنوات من وقت المحللين. تم قياس الجودة من خلال الاستبيانات والمقارنة الدلالية (تطابق دلالي بنسبة 92%، و71% من الحقول مقبولة دون تغيير). تتضمن الخطط المستقبلية الربط بتسليمات البيانات المنتظمة ونشر الوصف لكل عمود على حدة.
المصدر: Habr — хаб ИИ —
الأصلي
