Miten kuvailimme 15 000 taulua kuudessa kuukaudessa 500 sijasta vuodessa – ja lopetimme dokumentoinnin käsin kirjoittamisen
Яндекс
Yandex automatisoi tauludokumentaation käyttämällä suurta kielimallia hyödyntävää robottia, joka kerää metadataa eri lähteistä ja luo luonnoskuvauksia. Kuudessa kuukaudessa kuvailtiin 15 000 taulua, kun aiemmin manuaalinen työ tuotti 500 taulua vuodessa, mikä säästi noin viisi vuotta analyytikoiden työaikaa.
Yandex kohtasi valtavan datadokumentaatiohaasteen: 40 000 suodatetusta taulusta vain 500 sai manuaaliset kuvaukset vuodessa. Tekninen johtaja Roman Gridnev rakensi Python-robotit, joka hyödyntää suuria kielimalleja ja sisäisiä datalähteitä (datapolut, skeemat, otantadata, Wikin sanastot, Memgraphin naapurisolmut, kansioiden naapurit) luodakseen luonnoskuvauksia. Robotti kerää ensin objektiivista dataa ja lähettää sen sitten suurille kielimalleille otsikon ja kuvauksen tuottamista varten, välttäen tyhjää sivua. Kuvaukset ladataan Data Catalogiin, jossa ihmiset voivat tarkistaa ne. Kuudessa kuukaudessa 15 000 taulua kuvattiin, säästäen noin viisi vuotta analyytikoiden työaikaa. Laatua mitattiin kyselyillä ja semanttisella vertailulla (92 % semanttinen osumatarkkuus, 71 % kentistä hyväksyttiin muuttumattomina). Tulevaisuuden suunnitelmiin kuuluu yhdistäminen säännöllisiin datatoimituksiin ja kuvauksen levittäminen saraketasolle.
Lähde: Habr — хаб ИИ —
Alkuperäinen
