如何在六个月内描述15,000张表,而不是一年500张——并停止手动编写文档
Яндекс
Yandex 使用基于大型语言模型的机器人自动化表文档生成,该机器人从各种来源收集元数据并生成草稿描述。在六个月内,描述了15,000张表,而手动工作每年只能描述500张,节省了大约五年的分析师时间。
Yandex面临巨大的数据文档化挑战:在40,000张经过筛选的表中,一年内只有500张获得了人工描述。技术经理罗曼·格里德涅夫开发了一个Python机器人,利用大语言模型和内部数据源(数据路径、模式、样本数据、Wiki术语表、来自Memgraph的图邻居、文件夹邻居)生成草拟描述。该机器人首先收集客观数据,然后将其发送给大语言模型以生成标题和描述,避免了空白页面的情况。描述被加载到数据目录中,供人工审核。六个月间,15,000张表得到了描述,节省了大约五年的分析师时间。质量通过调查和语义比较来衡量(语义匹配率达92%,71%的字段未经修改即被接受)。未来计划包括接入常规数据传送以及按列描述传播。
来源: Habr — хаб ИИ —
原文
