Cách Đánh Giá Mức Độ Sẵn Sàng Của Dữ Liệu Cho AI: Khung 6C Của Snowflake
Snowflake
Hầu hết các dự án AI thất bại vì dữ liệu, không phải vì mô hình. Khung "6C" (Sạch - Clean, Ngữ cảnh - Contextual, Có thể tiêu thụ - Consumable, Hiện tại - Current, Tương quan - Correlated, Tuân thủ - Compliant) được trình bày để đánh giá mức độ sẵn sàng của dữ liệu cho các khối lượng công việc cụ thể: RAG, tác nhân, đặc trưng, huấn luyện. Snowflake cung cấp các công cụ (DMF, chế độ xem ngữ nghĩa, Cortex Search, v.v.) đáp ứng các yêu cầu này. Khung này được xuất bản dưới dạng kỹ năng mã nguồn mở cho các tác nhân.
Hầu hết các dự án AI thất bại do dữ liệu, không phải mô hình. Không giống như phân tích truyền thống, nơi dữ liệu kém chỉ dẫn đến biểu đồ sai, trong AI, các khuyết điểm tương tự được nhúng vào chỉ mục, được truy xuất và tạo ra các câu trả lời tự tin nhưng sai lệch, có khả năng dẫn đến hành động sai lầm. Khi tính tự động hóa của hệ thống tăng lên, hậu quả của các lỗi cũng gia tăng. Để đánh giá một cách có hệ thống mức độ sẵn sàng của dữ liệu, khung "6C" được đề xuất: Sạch (Clean), Ngữ cảnh (Contextual), Khả dụng (Consumable), Hiện tại (Current), Tương quan (Correlated) và Tuân thủ (Compliant). Mỗi yếu tố trong sáu yếu tố được mô tả chi tiết cho các loại khối lượng công việc khác nhau: Tạo sinh tăng cường truy xuất (RAG), tác nhân (agent), dịch vụ đặc trưng (feature services) và huấn luyện mô hình. Snowflake triển khai các yêu cầu 6C thông qua các công cụ của mình: Hàm số liệu dữ liệu (Data Metric Functions) để kiểm soát chất lượng, Chế độ xem ngữ nghĩa (Semantic Views) cho ngữ cảnh, Cortex Search cho tìm kiếm vector, Kho đặc trưng (Feature Store) để lưu trữ đặc trưng, Streams và Tasks cho tính hiện tại, Time Travel và ACCESS_HISTORY cho tương quan, và Horizon Catalog cho tuân thủ. Khung này được đóng gói dưới dạng một kỹ năng tác nhân mã nguồn mở thực hiện đánh giá dữ liệu sử dụng hơn 60 chỉ số cho một kịch bản khối lượng công việc nhất định (ví dụ: dịch vụ hoặc huấn luyện). Tác nhân có quyền truy cập chỉ đọc và mọi sửa đổi dữ liệu đều yêu cầu phê duyệt rõ ràng. Một đánh giá mẫu cho thấy: yếu tố Sạch đạt, trong khi Ngữ cảnh thất bại (với điểm số thấp cho tài liệu ngữ nghĩa). Kho lưu trữ dự án ở trên GitHub: github.com/Snowflake-Labs/ai-ready-data.
Nguồn: InfoQ 中国 —
bản gốc
