Como Descrevemos 15.000 Tabelas em Seis Meses em Vez de 500 em um Ano – e Paramos de Escrever Documentação Manualmente
Яндекс
A Yandex automatizou a documentação de tabelas usando um robô baseado em modelo de linguagem de grande escala que coleta metadados de várias fontes e gera rascunhos de descrições. Em seis meses, 15.000 tabelas foram descritas, em vez de 500 por ano com trabalho manual, economizando cerca de cinco anos de tempo de analista.
A Yandex enfrentou um enorme desafio de documentação de dados: de 40 mil tabelas filtradas, apenas 500 receberam descrições manuais em um ano. Roman Gridnev, gerente técnico, construiu um robô em Python que utiliza modelos de linguagem de grande escala (LLMs) e fontes de dados internas (caminhos de dados, esquemas, dados de amostra, glossários do Wiki, vizinhos de grafo do Memgraph, vizinhos de pasta) para gerar rascunhos de descrições. O robô primeiro coleta dados objetivos e depois os envia para um LLM produzir um título e uma descrição, evitando uma página em branco. As descrições são carregadas no Catálogo de Dados, onde humanos podem revisá-las. Em seis meses, 15 mil tabelas foram descritas, economizando cerca de cinco anos de trabalho de analistas. A qualidade foi medida por pesquisas e comparação semântica (92% de correspondência semântica, 71% dos campos aceitos inalterados). Planos futuros incluem conectar as entregas regulares de dados e a propagação de descrições por coluna.
Fonte: Habr — хаб ИИ —
original
