एआई के लिए डेटा तत्परता का आकलन कैसे करें: Snowflake का 6C फ्रेमवर्क
Snowflake
अधिकांश AI प्रोजेक्ट मॉडल के कारण नहीं, बल्कि डेटा के कारण विफल होते हैं। '6C' फ्रेमवर्क (क्लीन, कॉन्टेक्स्टुअल, कंस्यूमेबल, करंट, करिलेटेड, कंप्लाइंट) को विशिष्ट कार्यभार: RAG, एजेंट, फीचर्स, ट्रेनिंग के लिए डेटा तत्परता के आकलन हेतु प्रस्तुत किया गया है। Snowflake उपकरण (DMF, सिमैंटिक व्यूज, कॉर्टेक्स सर्च, आदि) प्रदान करता है जो इन आवश्यकताओं को पूरा करते हैं। यह फ्रेमवर्क एजेंटों के लिए एक ओपन-सोर्स स्किल के रूप में प्रकाशित किया गया है।
अधिकांश AI प्रोजेक्ट डेटा के कारण विफल होते हैं, न कि मॉडलों के कारण। पारंपरिक एनालिटिक्स के विपरीत, जहाँ खराब डेटा केवल गलत चार्ट की ओर ले जाता है, AI में वही दोष इंडेक्स में समा जाते हैं, रिट्रीव होते हैं, और आत्मविश्वासपूर्ण लेकिन गलत उत्तर उत्पन्न करते हैं, जो संभावित रूप से गलत कार्रवाइयों का कारण बन सकते हैं। जैसे-जैसे सिस्टम की स्वायत्तता बढ़ती है, त्रुटियों के परिणाम भी बढ़ते हैं। डेटा तत्परता के व्यवस्थित आकलन के लिए, '6C' फ्रेमवर्क प्रस्तावित है: क्लीन, कॉन्टेक्स्टुअल, कंज्यूमेबल, करंट, कोरिलेटेड और कम्प्लायंट। प्रत्येक छह कारक को विभिन्न वर्कलोड प्रकारों के लिए विस्तार से बताया गया है: रिट्रीवल-ऑग्मेंटेड जनरेशन, एजेंट, फीचर सर्विसेस और मॉडल ट्रेनिंग। Snowflake अपने टूल्स के माध्यम से 6C आवश्यकताओं को लागू करता है: गुणवत्ता नियंत्रण के लिए डेटा मेट्रिक फंक्शन्स, संदर्भ के लिए सिमैंटिक व्यूज़, वेक्टर सर्च के लिए कॉर्टेक्स सर्च, फीचर स्टोर करने के लिए फीचर स्टोर, करेंसी के लिए स्ट्रीम्स और टास्क, सहसंबंध के लिए टाइम ट्रैवल और एक्सेस_हिस्ट्री, और अनुपालन के लिए हॉरिज़न कैटलॉग। फ्रेमवर्क को एक ओपन-सोर्स एजेंट स्किल के रूप में पैकेज किया गया है जो किसी दिए गए वर्कलोड परिदृश्य (जैसे, सेवा या प्रशिक्षण) के लिए 60 से अधिक मेट्रिक्स का उपयोग करके डेटा आकलन चलाता है। एजेंट के पास केवल पढ़ने की पहुंच है, और किसी भी डेटा संशोधन के लिए स्पष्ट अनुमोदन आवश्यक है। एक उदाहरण मूल्यांकन में दिखाया गया: क्लीन फैक्टर पास हुआ, जबकि कॉन्टेक्स्टुअल फेल हुआ (सिमैंटिक डॉक्यूमेंटेशन के लिए कम अंक)। प्रोजेक्ट रिपॉजिटरी GitHub पर है: github.com/Snowflake-Labs/ai-ready-data।
स्रोत: InfoQ 中国 —
मूल
