Hoe we in zes maanden 15.000 tabellen beschreven in plaats van 500 in een jaar – en stopten met het handmatig schrijven van documentatie
Яндекс
Yandex automatiseerde tabeldocumentatie met een LLM-aangedreven robot die metadata verzamelt uit verschillende bronnen en conceptbeschrijvingen genereert. In zes maanden werden 15.000 tabellen beschreven in plaats van 500 per jaar met handmatig werk, wat ongeveer vijf jaar aan analistentijd bespaarde.
Yandex stond voor een enorme uitdaging op het gebied van datadocumentatie: van de 40.000 gefilterde tabellen kregen er in een jaar slechts 500 een handmatige beschrijving. Roman Gridnev, een technisch manager, bouwde een Python-robot die gebruikmaakt van grote taalmodellen (LLM's) en interne databronnen (datapaden, schema's, voorbeelddata, Wiki-woordenlijsten, graafburen van Memgraph, mapburen) om conceptbeschrijvingen te genereren. De robot verzamelt eerst objectieve gegevens en stuurt deze vervolgens naar een LLM om een titel en beschrijving te produceren, waardoor een lege pagina wordt vermeden. De beschrijvingen worden geladen in de Data Catalog, waar mensen ze kunnen beoordelen. In zes maanden tijd werden 15.000 tabellen beschreven, wat ongeveer vijf jaar aan analistentijd bespaarde. De kwaliteit werd gemeten via enquêtes en semantische vergelijking (92% semantische overeenkomst, 71% van de velden ongewijzigd geaccepteerd). Toekomstige plannen omvatten het aansluiten op reguliere dataleveringen en het doorpropageren van beschrijvingen per kolom.
Bron: Habr — хаб ИИ —
origineel
