Nghiên cứuỨng dụng 🇷🇺 28.07.2026 14:01

Cách các mô hình ngôn ngữ lớn có thể giúp xác định dòng dữ liệu

СберСбер
Bài viết thảo luận về việc sử dụng các mô hình ngôn ngữ lớn (LLM) để tự động trích xuất dòng dữ liệu từ mã SQL. Nó trình bày một phương pháp dựa trên GigaChat của Sber, đạt điểm F1 cao. Một vòng lặp phản hồi dựa trên tác nhân tối ưu hóa lời nhắc, và một giao diện web được xây dựng bằng Streamlit trực quan hóa kết quả.
Bài viết đề cập đến thách thức trong việc duy trì Dòng dữ liệu chính xác trong các môi trường dữ liệu phức tạp. Các tác giả đề xuất sử dụng các LLM để tự động phân tích các tập lệnh SQL và trích xuất các bảng nguồn và bảng đích. Họ đã chọn 127 tập lệnh kiểm thử có độ phức tạp khác nhau. Sử dụng GigaChat, họ đã phát triển lớp SQLLineageExtractor với LangChain. Kết quả ban đầu cho thấy điểm F1 là 0,7898 đối với GigaChat cơ bản và 0,9218 đối với GigaChat 2 Pro. Để cải thiện chất lượng prompt, họ đã tạo ra một tác nhân thông minh (GigaChatSQLLineageAgent) dựa trên LangGraph, giúp tinh chỉnh prompt một cách lặp đi lặp lại bằng cách sử dụng phản hồi xác thực, đạt được F1 là 0,9336. Một giao diện web Streamlit đã được xây dựng để phân tích SQL đơn lẻ và hàng loạt, cung cấp khả năng trực quan hóa phụ thuộc.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới