Comment nous avons décrit 15 000 tables en six mois au lieu de 500 en un an – et arrêté d'écrire la documentation à la main
Яндекс
Yandex a automatisé la documentation des tables à l'aide d'un robot basé sur un modèle de langage de grande taille (LLM) qui collecte les métadonnées de diverses sources et génère des descriptions provisoires. En six mois, 15 000 tables ont été décrites, contre 500 par an avec un travail manuel, économisant ainsi environ cinq années de temps d'analyste.
Yandex a été confronté à un défi colossal de documentation de données : sur 40 000 tables filtrées, seulement 500 ont reçu des descriptions manuelles en un an. Roman Gridnev, un responsable technique, a développé un robot Python qui utilise des LLM et des sources de données internes (chemins de données, schémas, échantillons de données, glossaires Wiki, voisins de graphe de Memgraph, voisins de dossier) pour générer des ébauches de descriptions. Le robot rassemble d'abord des données objectives, puis les envoie à un LLM pour produire un titre et une description, évitant ainsi une page blanche. Les descriptions sont chargées dans le catalogue de données, où les humains peuvent les examiner. En six mois, 15 000 tables ont été décrites, économisant environ cinq ans de temps d'analyste. La qualité a été mesurée par des enquêtes et une comparaison sémantique (correspondance sémantique de 92 %, 71 % des champs acceptés sans modification). Les projets futurs incluent la connexion aux livraisons régulières de données et la propagation des descriptions par colonne.
Source: Habr — хаб ИИ —
original
