Cómo los LLMs pueden ayudar a determinar la procedencia de los datos
Сбер
El artículo analiza el uso de modelos de lenguaje grandes (LLMs) para extraer automáticamente la procedencia de los datos (Data Lineage) a partir de código SQL. Presenta un enfoque basado en GigaChat de Sber, que logra puntuaciones altas de F1. Un bucle de reflexión basado en agentes optimiza los prompts, y una interfaz web construida con Streamlit visualiza los resultados.
El artículo aborda el desafío de mantener una Linaje de Datos precisa en entornos de datos complejos. Los autores proponen el uso de LLMs para analizar automáticamente scripts SQL y extraer tablas de origen y destino. Seleccionaron 127 scripts de prueba de diversa complejidad. Utilizando GigaChat, desarrollaron la clase SQLLineageExtractor con LangChain. Los resultados iniciales mostraron puntuaciones F1 de 0,7898 para GigaChat básico y 0,9218 para GigaChat 2 Pro. Para mejorar la calidad de los prompts, crearon un agente inteligente (GigaChatSQLLineageAgent) basado en LangGraph que refina iterativamente los prompts utilizando retroalimentación de validación, logrando un F1 de 0,9336. Se construyó una interfaz web con Streamlit para análisis SQL individual y por lotes, proporcionando visualización de dependencias.
Fuente: Habr — хаб ИИ —
original
