AplikasiModel 🇷🇺 29.07.2026 12:04

Bagaimana Kami Mendeskripsikan 15.000 Tabel dalam Enam Bulan, Bukan 500 dalam Setahun – dan Berhenti Menulis Dokumentasi dengan Tangan

ЯндексЯндекс
Yandex mengotomatiskan dokumentasi tabel menggunakan robot berbasis Large Language Model (LLM) yang mengumpulkan metadata dari berbagai sumber dan menghasilkan deskripsi draf. Dalam enam bulan, 15.000 tabel berhasil dideskripsikan, dibandingkan dengan 500 tabel per tahun dengan kerja manual, sehingga menghemat sekitar lima tahun waktu analis.
Yandex menghadapi tantangan dokumentasi data yang besar: dari 40.000 tabel yang difilter, hanya 500 yang mendapatkan deskripsi manual dalam setahun. Roman Gridnev, seorang manajer teknis, membangun robot Python yang menggunakan Large Language Model (LLM) dan sumber data internal (jalur data, skema, data sampel, glosarium Wiki, tetangga grafik dari Memgraph, tetangga folder) untuk menghasilkan draf deskripsi. Robot ini pertama-tama mengumpulkan data objektif, lalu mengirimkannya ke LLM untuk menghasilkan judul dan deskripsi, menghindari halaman kosong. Deskripsi dimuat ke dalam Katalog Data, tempat manusia dapat meninjaunya. Dalam enam bulan, 15.000 tabel telah dideskripsikan, menghemat sekitar lima tahun waktu analis. Kualitas diukur melalui survei dan perbandingan semantik (kecocokan semantik 92%, 71% bidang diterima tanpa perubahan). Rencana ke depan termasuk menghubungkan ke pengiriman data reguler dan propagasi deskripsi per kolom.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru