LLM'ler Veri Soyunu Belirlemeye Nasıl Yardımcı Olabilir
Сбер
Makale, büyük dil modellerini (large language models, LLM'ler) kullanarak SQL kodundan Veri Soyunu otomatik olarak çıkarmayı ele alıyor. Sber'den GigaChat'e dayanan bir yaklaşım sunuyor ve yüksek F1 skorları elde ediyor. Ajan tabanlı bir yansıma döngüsü, istemleri optimize ediyor ve Streamlit ile oluşturulmuş bir web arayüzü sonuçları görselleştiriyor.
Makale, karmaşık veri ortamlarında Doğru Veri Soy Ağacı (Data Lineage) sağlamanın zorluğunu ele alıyor. Yazarlar, SQL betiklerini otomatik olarak ayrıştırmak ve hedef ile kaynak tabloları çıkarmak için LLM'lerin kullanılmasını öneriyor. Farklı karmaşıklık seviyelerinde 127 test betiği seçildi. GigaChat kullanılarak, LangChain ile SQLLineageExtractor sınıfı geliştirildi. İlk sonuçlar, temel GigaChat için 0,7898 ve GigaChat 2 Pro için 0,9218'lik F1 skoru gösterdi. İstem kalitesini artırmak için, doğrulama geri bildirimini kullanarak istemleri yinelemeli olarak iyileştiren LangGraph tabanlı akıllı bir ajan (GigaChatSQLLineageAgent) oluşturuldu ve 0,9336 F1 elde edildi. Tek ve toplu SQL analizi için, bağımlılık görselleştirmesi sağlayan bir Streamlit web arayüzü oluşturuldu.
Kaynak: Habr — хаб ИИ —
orijinal
