Bagaimana LLM Dapat Membantu Menentukan Data Lineage
Сбер
Artikel ini membahas penggunaan large language models (LLM) untuk mengekstrak Data Lineage secara otomatis dari kode SQL. Pendekatan ini didasarkan pada GigaChat dari Sber, mencapai skor F1 yang tinggi. Sebuah loop refleksi berbasis agen mengoptimalkan prompt, dan antarmuka web yang dibangun dengan Streamlit memvisualisasikan hasilnya.
Artikel ini membahas tantangan menjaga Akurasi Lineage Data di lingkungan data yang kompleks. Para penulis mengusulkan penggunaan LLM untuk mengurai skrip SQL secara otomatis dan mengekstrak tabel target dan sumber. Mereka memilih 127 skrip uji dengan tingkat kerumitan yang bervariasi. Menggunakan GigaChat, mereka mengembangkan kelas SQLLineageExtractor dengan LangChain. Hasil awal menunjukkan skor F1 sebesar 0,7898 untuk GigaChat dasar dan 0,9218 untuk GigaChat 2 Pro. Untuk meningkatkan kualitas prompt, mereka membuat agen cerdas (GigaChatSQLLineageAgent) berdasarkan LangGraph yang secara iteratif menyempurnakan prompt menggunakan umpan balik validasi, mencapai F1 sebesar 0,9336. Antarmuka web Streamlit dibangun untuk analisis SQL tunggal dan batch, menyediakan visualisasi dependensi.
Sumber: Habr — хаб ИИ —
asli
