Aplicaciones 🇨🇳 24.07.2026 06:01

Cómo evaluar la preparación de los datos para IA: el marco 6C de Snowflake

SnowflakeSnowflake
La mayoría de los proyectos de IA fracasan por los datos, no por los modelos. Se presenta el marco "6C" (limpio, contextual, consumible, actual, correlacionado, conforme) para evaluar la preparación de los datos para cargas de trabajo específicas: RAG, agentes, características, entrenamiento. Snowflake ofrece herramientas (DMF, vistas semánticas, Cortex Search, entre otras) que cumplen estos requisitos. El marco se publica como una habilidad de código abierto para agentes.
La mayoría de los proyectos de IA fracasan por los datos, no por los modelos. A diferencia de la analítica tradicional, donde unos datos deficientes solo generan gráficos incorrectos, en la IA los mismos defectos se incrustan en los índices, se recuperan y producen respuestas seguras pero falsas, lo que puede llevar a acciones erróneas. A medida que aumenta la autonomía del sistema, las consecuencias de los errores se amplifican. Para una evaluación sistemática de la preparación de los datos, se propone el marco "6C": Clean (Limpio), Contextual (Contextual), Consumable (Consumible), Current (Actual), Correlated (Correlacionado) y Compliant (Conforme). Cada uno de los seis factores se detalla para diferentes tipos de cargas de trabajo: Generación Aumentada por Recuperación (RAG, por sus siglas en inglés), agentes, servicios de atributos (feature services) y entrenamiento de modelos. Snowflake implementa los requisitos 6C a través de sus herramientas: Data Metric Functions para el control de calidad, Semantic Views para el contexto, Cortex Search para la búsqueda vectorial, Feature Store para almacenar atributos, Streams y Tasks para la actualidad, Time Travel y ACCESS_HISTORY para la correlación, y Horizon Catalog para el cumplimiento normativo. El marco se empaqueta como una habilidad de agente de código abierto que ejecuta evaluaciones de datos utilizando más de 60 métricas para un escenario de carga de trabajo determinado (por ejemplo, servicio o entrenamiento). El agente tiene acceso de solo lectura, y cualquier modificación de datos requiere aprobación explícita. Una evaluación de ejemplo mostró que el factor Clean (Limpio) fue exitoso, mientras que Contextual (Contextual) falló (con puntuaciones bajas en documentación semántica). El repositorio del proyecto está en GitHub: github.com/Snowflake-Labs/ai-ready-data.
Fuente: InfoQ 中国 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas