研究应用 🇷🇺 28.07.2026 14:01

LLM如何帮助确定数据血缘关系

СберСбер
本文讨论了使用大型语言模型自动从SQL代码中提取数据血缘关系的方法。基于Sber的GigaChat提出的方法取得了高F1分数。采用基于智能体的反思循环优化提示词,并使用Streamlit构建的Web界面可视化结果。
本文探讨了在复杂数据环境中维护精准数据血统的挑战。作者提出利用大语言模型自动解析SQL脚本并提取目标表与源表。他们选取了127个不同复杂度的测试脚本,使用GigaChat开发了基于LangChain的SQLLineageExtractor类。初步结果显示,基础版GigaChat的F1得分为0.7898,而GigaChat 2 Pro为0.9218。为提升提示质量,他们基于LangGraph构建了一个智能代理(GigaChatSQLLineageAgent),该代理通过验证反馈迭代优化提示,最终F1得分达到0.9336。此外,还搭建了基于Streamlit的Web界面,支持单次及批量SQL分析,并提供了依赖关系可视化。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻