التطبيقات 🇨🇳 24.07.2026 06:01

كيفية تقييم جاهزية البيانات للذكاء الاصطناعي: إطار 6C من Snowflake

SnowflakeSnowflake
معظم مشاريع الذكاء الاصطناعي تفشل بسبب البيانات وليس النماذج. يُقدَّم إطار "6C" (نظيفة، سياقية، قابلة للاستهلاك، حالية، مترابطة، متوافقة) لتقييم جاهزية البيانات لأحمال العمل المحددة: RAG، الوكلاء، الميزات، التدريب. تقدم Snowflake أدوات (DMF، عروض دلالية، Cortex Search، إلخ) تلبي هذه المتطلبات. يُنشر الإطار كمهارة مفتوحة المصدر للوكلاء.
تفشل معظم مشاريع الذكاء الاصطناعي بسبب البيانات، لا النماذج. على عكس التحليلات التقليدية، حيث تؤدي البيانات الرديئة إلى رسوم بيانية غير صحيحة فحسب، في الذكاء الاصطناعي تنغرس العيوب نفسها في الفهارس، وتُسترد، وتنتج إجابات واثقة لكنها خاطئة، مما قد يؤدي إلى إجراءات خاطئة. مع زيادة استقلالية النظام، تتضخم عواقب الأخطاء. للتقييم المنهجي لجاهزية البيانات، يُقترح إطار "6C": النظافة، السياق، القابلية للاستهلاك، الحداثة، الارتباط، والامتثال. يتم تفصيل كل عامل من العوامل الستة لأنواع مختلفة من أعباء العمل: التوليد المعزز بالاسترجاع، الوكلاء، خدمات الميزات، وتدريب النماذج. تنفذ سنووكلود متطلبات 6C من خلال أدواتها: دوال المقاييس البياناتية لمراقبة الجودة، العروض الدلالية للسياق، بحث كورتكس للبحث المتجهي، مخزن الميزات لتخزين الميزات، البث والمهام للحداثة، السفر عبر الزمن وسجل الوصول للارتباط، ودليل الأفق للامتثال. يُحزم الإطار كمهارة وكيل مفتوحة المصدر تُجري تقييمات بيانات باستخدام أكثر من 60 مقياسًا لسيناريو عبء عمل معين (مثل الخدمة أو التدريب). لدى الوكيل صلاحيات قراءة فقط، وأي تعديل على البيانات يتطلب موافقة صريحة. أظهر تقييم مثال: نجح عامل النظافة، بينما فشل عامل السياق (بنقص درجات للتوثيق الدلالي). مستودع المشروع على غيت هاب: github.com/Snowflake-Labs/ai-ready-data
المصدر: InfoQ 中国 — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة