शोधअनुप्रयोग 🇷🇺 28.07.2026 14:01

एलएलएम कैसे डेटा लिनिएज निर्धारित करने में मदद कर सकते हैं

СберСбер
यह लेख बड़े भाषा मॉडल (एलएलएम) का उपयोग करके SQL कोड से डेटा लिनिएज स्वचालित रूप से निकालने की चर्चा करता है। यह स्बेर के GigaChat पर आधारित एक दृष्टिकोण प्रस्तुत करता है, जो उच्च F1 स्कोर प्राप्त करता है। एक एजेंट-आधारित रिफ्लेक्शन लूप प्रॉम्प्ट को अनुकूलित करता है, और Streamlit से निर्मित एक वेब इंटरफेस परिणामों को विज़ुअलाइज़ करता है।
यह लेख जटिल डेटा वातावरण में सटीक डेटा लिनेज बनाए रखने की चुनौती को संबोधित करता है। लेखक एलएलएम (LLM) का उपयोग करके एसक्यूएल स्क्रिप्ट्स को स्वचालित रूप से पार्स करने और लक्ष्य तथा स्रोत तालिकाओं को निकालने का प्रस्ताव करते हैं। उन्होंने अलग-अलग जटिलता के 127 परीक्षण स्क्रिप्ट्स का चयन किया। गीगाचैट (GigaChat) का उपयोग करके, उन्होंने लैंगचेन (LangChain) के साथ SQLLineageExtractor क्लास विकसित किया। प्रारंभिक परिणामों में बेसिक गीगाचैट के लिए 0.7898 और गीगाचैट 2 प्रो (GigaChat 2 Pro) के लिए 0.9218 का F1 स्कोर दिखा। प्रॉम्प्ट गुणवत्ता में सुधार के लिए, उन्होंने लैंगग्राफ (LangGraph) पर आधारित एक बुद्धिमान एजेंट (GigaChatSQLLineageAgent) बनाया जो सत्यापन प्रतिक्रिया का उपयोग करके प्रॉम्प्ट को पुनरावृत्त रूप से परिष्कृत करता है, जिससे 0.9336 का F1 स्कोर प्राप्त हुआ। एकल और बैच एसक्यूएल विश्लेषण के लिए एक स्ट्रीमलिट (Streamlit) वेब इंटरफ़ेस बनाया गया, जो निर्भरता विज़ुअलाइज़ेशन प्रदान करता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार