शोधअनुप्रयोग 🇷🇺 28.07.2026 14:01

LLMs डेटा लिनिएज निर्धारित करने में कैसे मदद कर सकते हैं

СберСбер
लेख बड़े भाषा मॉडल (LLMs) का उपयोग करके SQL कोड से स्वचालित रूप से डेटा लिनिएज निकालने पर चर्चा करता है। यह Sber के GigaChat पर आधारित एक दृष्टिकोण प्रस्तुत करता है, जो उच्च F1 स्कोर प्राप्त करता है। एक एजेंट-आधारित रिफ्लेक्शन लूप प्रॉम्प्ट को अनुकूलित करता है, और Streamlit के साथ निर्मित एक वेब इंटरफ़ेस परिणामों को विज़ुअलाइज़ करता है।
यह लेख जटिल डेटा वातावरण में सटीक डेटा लिनेज बनाए रखने की चुनौती को संबोधित करता है। लेखक एलएलएम (LLM) का उपयोग करके एसक्यूएल स्क्रिप्ट्स को स्वचालित रूप से पार्स करने और लक्ष्य तथा स्रोत तालिकाओं को निकालने का प्रस्ताव करते हैं। उन्होंने अलग-अलग जटिलता के 127 परीक्षण स्क्रिप्ट्स का चयन किया। गीगाचैट (GigaChat) का उपयोग करके, उन्होंने लैंगचेन (LangChain) के साथ SQLLineageExtractor क्लास विकसित किया। प्रारंभिक परिणामों में बेसिक गीगाचैट के लिए 0.7898 और गीगाचैट 2 प्रो (GigaChat 2 Pro) के लिए 0.9218 का F1 स्कोर दिखा। प्रॉम्प्ट गुणवत्ता में सुधार के लिए, उन्होंने लैंगग्राफ (LangGraph) पर आधारित एक बुद्धिमान एजेंट (GigaChatSQLLineageAgent) बनाया जो सत्यापन प्रतिक्रिया का उपयोग करके प्रॉम्प्ट को पुनरावृत्त रूप से परिष्कृत करता है, जिससे 0.9336 का F1 स्कोर प्राप्त हुआ। एकल और बैच एसक्यूएल विश्लेषण के लिए एक स्ट्रीमलिट (Streamlit) वेब इंटरफ़ेस बनाया गया, जो निर्भरता विज़ुअलाइज़ेशन प्रदान करता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार