연구애플리케이션 🇷🇺 28.07.2026 14:01

LLM이 데이터 계보 분석을 돕는 방법

СберСбер
이 기사는 대규모 언어 모델(LLM)을 사용하여 SQL 코드에서 데이터 계보를 자동으로 추출하는 방법을 논의합니다. Sber의 GigaChat을 기반으로 한 접근 방식을 제시하며, 높은 F1 점수를 달성합니다. 에이전트 기반 반성 루프가 프롬프트를 최적화하고, Streamlit으로 구축된 웹 인터페이스가 결과를 시각화합니다.
이 기사는 복잡한 데이터 환경에서 정확한 데이터 계보(Data Lineage)를 유지하는 과제를 다룹니다. 저자들은 LLM을 사용하여 SQL 스크립트를 자동으로 파싱하고 대상 및 소스 테이블을 추출하는 방법을 제안합니다. 다양한 복잡성을 가진 127개의 테스트 스크립트를 선정했습니다. GigaChat을 사용하여 LangChain 기반의 SQLLineageExtractor 클래스를 개발했습니다. 초기 결과는 기본 GigaChat에서 F1 점수 0.7898, GigaChat 2 Pro에서 0.9218을 보였습니다. 프롬프트 품질을 개선하기 위해 LangGraph 기반의 지능형 에이전트(GigaChatSQLLineageAgent)를 만들어 검증 피드백을 통해 프롬프트를 반복적으로 정제했으며, F1 점수 0.9336을 달성했습니다. 단일 및 배치 SQL 분석을 위한 Streamlit 웹 인터페이스가 구축되어 의존성 시각화를 제공합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스