TutkimusSovellukset 🇷🇺 28.07.2026 14:01

Kuinka suuret kielimallit voivat auttaa määrittämään datan alkuperän

СберСбер
Artikkelissa käsitellään suurten kielimallien (large language models, LLM) käyttöä datan alkuperän (Data Lineage) automaattiseen erottamiseen SQL-koodista. Siinä esitellään Sberin GigaChatiin perustuva lähestymistapa, joka saavuttaa korkeat F1-pisteet. Agenttipohjainen reflektiosilmukka optimoi kehotteita, ja Streamlitillä rakennettu verkkokäyttöliittymä visualisoi tulokset.
Artikkelissa käsitellään haastetta ylläpitää tarkkaa tietojen alkuperäketjua (data lineage) monimutkaisissa tietoympäristöissä. Tekijät ehdottavat suurten kielimallien (large language models, LLM) käyttöä SQL-skriptien automaattiseen jäsentämiseen ja kohde- ja lähdetaulujen poimimiseen. He valitsivat 127 testiskriptiä, jotka vaihtelivat vaikeustasoltaan. GigaChatia hyödyntäen he kehittivät SQLLineageExtractor-luokan LangChainin avulla. Alkuvaiheen tulokset osoittivat F1-pisteitä 0,7898 perus-GigaChatille ja 0,9218 GigaChat 2 Prolle. Parantaakseen kehotteiden laatua he loivat älykkään agentin (GigaChatSQLLineageAgent), joka perustuu LangGraphiin ja iteroi kehotteita validointipalautteen avulla saavuttaen F1-arvon 0,9336. He rakensivat Streamlit-verkkokäyttöliittymän yksittäisten ja eräajo-SQL-skriptien analysointiin, mikä mahdollistaa riippuvuuksien visualisoinnin.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset