Hoe LLM's kunnen helpen bij het bepalen van data lineage
Сбер
Het artikel bespreekt het gebruik van grote taalmodellen (LLM's) om automatisch Data Lineage uit SQL-code te extraheren. Het presenteert een aanpak op basis van GigaChat van Sber, met hoge F1-scores. Een agent-gebaseerde reflectielus optimaliseert prompts en een webinterface gebouwd met Streamlit visualiseert de resultaten.
Het artikel behandelt de uitdaging van het accuraat bijhouden van Data Lineage in complexe data-omgevingen. De auteurs stellen voor om LLM's te gebruiken om automatisch SQL-scripts te parsen en doel- en brontabellen te extraheren. Ze selecteerden 127 testscripts van verschillende complexiteit. Met behulp van GigaChat ontwikkelden ze de SQLLineageExtractor-klasse met LangChain. Eerste resultaten toonden F1-scores van 0,7898 voor standaard GigaChat en 0,9218 voor GigaChat 2 Pro. Om de promptkwaliteit te verbeteren, creëerden ze een intelligente agent (GigaChatSQLLineageAgent) op basis van LangGraph die prompts iteratief verfijnt met behulp van validatiefeedback, wat leidde tot een F1-score van 0,9336. Er werd een Streamlit-webinterface gebouwd voor enkele en batch-SQL-analyse, die afhankelijkheidsvisualisatie biedt.
Bron: Habr — хаб ИИ —
origineel
