الأبحاثالتطبيقات 🇷🇺 28.07.2026 14:01

كيف يمكن لنماذج اللغة الكبيرة المساعدة في تحديد سلسلة البيانات

СберСбер
يناقش المقال استخدام نماذج اللغة الكبيرة (LLMs) لاستخراج سلسلة البيانات تلقائياً من كود SQL. يقدم المقال نهجاً يعتمد على GigaChat من Sber، محققاً درجات F1 عالية. تعمل حلقة تأمل مبنية على الوكيل على تحسين الاستفسارات، وتقوم واجهة ويب مبنية باستخدام Streamlit بتصوير النتائج.
تتناول المقالة التحدي المتمثل في الحفاظ على دقة تتبع نسب البيانات (Data Lineage) في بيئات البيانات المعقدة. يقترح المؤلفون استخدام نماذج اللغة الكبيرة (LLMs) لتحليل نصوص SQL تلقائيًا واستخراج الجداول المصدر والهدف. تم اختيار 127 نص اختبار بمستويات تعقيد متفاوتة. باستخدام GigaChat، قاموا بتطوير فئة SQLLineageExtractor مع LangChain. أظهرت النتائج الأولية درجات F1 بلغت 0.7898 لـ GigaChat الأساسي و0.9218 لـ GigaChat 2 Pro. لتحسين جودة المطالبات النصية (prompts)، أنشأوا وكيلًا ذكيًا (GigaChatSQLLineageAgent) يعتمد على LangGraph يقوم بتعديل المطالبات النصية بشكل تكراري باستخدام ملاحظات التحقق، محققًا درجة F1 بلغت 0.9336. تم إنشاء واجهة ويب باستخدام Streamlit لتحليل SQL الفردي والدفعي، مع توفير تصور للتبعيات.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة