Как LLM могут помочь определить происхождение данных
Сбер
В статье рассматривается использование больших языковых моделей (Large Language Models, LLM) для автоматического извлечения происхождения данных (Data Lineage) из SQL-кода. Представлен подход на основе GigaChat от Сбера, достигающий высоких показателей F1. Агентно-ориентированный рефлексивный цикл оптимизирует подсказки, а веб-интерфейс на Streamlit визуализирует результаты.
Статья посвящена задаче поддержания точной трассировки данных (Data Lineage) в сложных дата-средах. Авторы предлагают использовать большие языковые модели (Large Language Models, LLMs) для автоматического разбора SQL-скриптов с извлечением целевых и исходных таблиц. Было отобрано 127 тестовых скриптов различной сложности. С помощью GigaChat разработан класс SQLLineageExtractor на базе LangChain.
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
