Cómo describimos 15 000 tablas en seis meses en lugar de 500 en un año, y dejamos de escribir documentación a mano
Яндекс
Yandex automatizó la documentación de tablas mediante un robot basado en un modelo de lenguaje de gran tamaño que recopila metadatos de diversas fuentes y genera borradores de descripciones. En seis meses, se describieron 15 000 tablas en lugar de 500 al año con trabajo manual, ahorrando aproximadamente cinco años de trabajo de analistas.
Yandex enfrentó un enorme desafío de documentación de datos: de 40.000 tablas filtradas, solo 500 recibieron descripciones manuales en un año. Roman Gridnev, un gerente técnico, construyó un robot en Python que utiliza LLMs y fuentes de datos internas (rutas de datos, esquemas, datos de muestra, glosarios de Wiki, vecinos de grafo de Memgraph, vecinos de carpeta) para generar borradores de descripciones. El robot primero recopila datos objetivos, luego los envía a un LLM para producir un título y una descripción, evitando una página en blanco. Las descripciones se cargan en el Catálogo de Datos, donde los humanos pueden revisarlas. En seis meses, se describieron 15.000 tablas, ahorrando aproximadamente cinco años de tiempo de analistas. La calidad se midió mediante encuestas y comparación semántica (92% de coincidencia semántica, 71% de campos aceptados sin cambios). Los planes futuros incluyen conectarse a entregas de datos regulares y propagar descripciones por columna.
Fuente: Habr — хаб ИИ —
original
