Ứng dụngMô hình 🇷🇺 29.07.2026 12:04

Cách chúng tôi mô tả 15.000 bảng trong sáu tháng thay vì 500 bảng trong một năm – và ngừng viết tài liệu bằng tay

ЯндексЯндекс
Yandex đã tự động hóa việc tài liệu hóa bảng bằng một robot dựa trên mô hình ngôn ngữ lớn (LLM) thu thập siêu dữ liệu từ nhiều nguồn khác nhau và tạo ra các bản mô tả nháp. Trong sáu tháng, 15.000 bảng đã được mô tả thay vì 500 bảng mỗi năm với công việc thủ công, tiết kiệm khoảng năm năm thời gian của nhà phân tích.
Yandex đối mặt với thách thức lớn về tài liệu hóa dữ liệu: trong số 40.000 bảng đã được lọc, chỉ có 500 bảng có mô tả thủ công trong một năm. Roman Gridnev, một quản lý kỹ thuật, đã xây dựng một robot Python sử dụng các mô hình ngôn ngữ lớn (LLM) và các nguồn dữ liệu nội bộ (đường dẫn dữ liệu, lược đồ, dữ liệu mẫu, từ điển Wiki, các nút lân cận từ Memgraph, các thư mục lân cận) để tạo ra các bản mô tả nháp. Robot đầu tiên thu thập dữ liệu khách quan, sau đó gửi đến một LLM để tạo tiêu đề và mô tả, tránh tình trạng trang trống. Các mô tả được tải vào Danh mục dữ liệu (Data Catalog), nơi con người có thể xem xét. Trong sáu tháng, 15.000 bảng đã được mô tả, tiết kiệm khoảng năm năm thời gian của các nhà phân tích. Chất lượng được đo bằng khảo sát và so sánh ngữ nghĩa (tương đồng ngữ nghĩa 92%, 71% trường được chấp nhận mà không thay đổi). Kế hoạch tương lai bao gồm kết nối với các luồng dữ liệu thường xuyên và mở rộng mô tả theo từng cột.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới