Évaluer la préparation des données pour l'IA : le framework 6C de Snowflake
Snowflake
La plupart des projets d'IA échouent en raison des données, non des modèles. Le framework « 6C » (Clean, Contextual, Consumable, Current, Correlated, Compliant) est présenté pour évaluer la préparation des données pour des charges de travail spécifiques : RAG, agents, features, entraînement. Snowflake propose des outils (DMF, vues sémantiques, Cortex Search, etc.) qui répondent à ces exigences. Le framework est publié comme une compétence open-source pour les agents.
La plupart des projets d'IA échouent à cause des données, pas des modèles. Contrairement à l'analyse traditionnelle, où des données pauvres conduisent simplement à des graphiques incorrects, dans l'IA, les mêmes défauts deviennent intégrés dans les index, sont récupérés et produisent des réponses confiantes mais fausses, pouvant mener à des actions erronées. À mesure que l'autonomie du système augmente, les conséquences des erreurs s'amplifient. Pour une évaluation systématique de la préparation des données, le cadre « 6C » est proposé : propre (Clean), contextuel (Contextual), consommable (Consumable), actuel (Current), corrélé (Correlated) et conforme (Compliant). Chacun des six facteurs est détaillé pour différents types de charges de travail : la génération augmentée par récupération (Retrieval-Augmented Generation, RAG), les agents, les services de caractéristiques (feature services) et l'entraînement de modèles. Snowflake met en œuvre les exigences 6C via ses outils : Data Metric Functions pour le contrôle qualité, Semantic Views pour le contexte, Cortex Search pour la recherche vectorielle, Feature Store pour le stockage des caractéristiques, Streams and Tasks pour l'actualité, Time Travel et ACCESS_HISTORY pour la corrélation, et Horizon Catalog pour la conformité. Le cadre est emballé sous forme d'une compétence d'agent open source qui exécute des évaluations de données à l'aide de plus de 60 métriques pour un scénario de charge de travail donné (par exemple, service ou entraînement). L'agent a un accès en lecture seule, et toute modification des données nécessite une approbation explicite. Un exemple d'évaluation a montré : le facteur Propre (Clean) a été validé, tandis que Contextuel (Contextual) a échoué (avec des scores faibles pour la documentation sémantique). Le dépôt du projet se trouve sur GitHub : github.com/Snowflake-Labs/ai-ready-data.
Source: InfoQ 中国 —
original
