ForschungAnwendungen 🇷🇺 28.07.2026 14:01

Wie LLMs bei der Datenherkunft helfen können

СберСбер
Der Artikel erörtert die Verwendung großer Sprachmodelle (LLMs) zur automatischen Extraktion von Datenherkunft (Data Lineage) aus SQL-Code. Es wird ein Ansatz vorgestellt, der auf GigaChat von Sber basiert und hohe F1-Werte erzielt. Eine agentenbasierte Reflexionsschleife optimiert die Aufforderungen (Prompts), und eine mit Streamlit erstellte Weboberfläche visualisiert die Ergebnisse.
Der Artikel befasst sich mit der Herausforderung, eine genaue Data Lineage in komplexen Datenumgebungen aufrechtzuerhalten. Die Autoren schlagen vor, große Sprachmodelle (Large Language Models, LLMs) zu verwenden, um SQL-Skripte automatisch zu parsen und Ziel- sowie Quelltables zu extrahieren. Sie wählten 127 Testskripte unterschiedlicher Komplexität aus. Unter Verwendung von GigaChat entwickelten sie die SQLLineageExtractor-Klasse mit LangChain. Erste Ergebnisse zeigten F1-Werte von 0,7898 für das Basismodell GigaChat und 0,9218 für GigaChat 2 Pro. Um die Prompt-Qualität zu verbessern, erstellten sie einen intelligenten Agenten (GigaChatSQLLineageAgent) basierend auf LangGraph, der Prompts iterativ mithilfe von Validierungsfeedback verfeinert und einen F1-Wert von 0,9336 erreicht. Eine Streamlit-Weboberfläche wurde für die Analyse einzelner und mehrerer SQL-Abfragen entwickelt, die eine Abhängigkeitsvisualisierung bietet.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten