Simula: तंत्र और तर्क के आधार पर सिंथेटिक डेटासेट डिजाइन करने का एक ढांचा
Google/DeepMind
गूगल रिसर्च सिंथेटिक डेटा जनरेशन को डेटासेट-स्तरीय तंत्र डिजाइन के रूप में पुनर्परिभाषित करने वाला एक ढांचा, Simula पेश करता है। यह पहले सिद्धांतों से पूरे डेटासेट का निर्माण करने के लिए तर्क-प्रथम पद्धति का उपयोग करता है, जिससे कवरेज, जटिलता और गुणवत्ता पर सूक्ष्म नियंत्रण संभव होता है। Simula गूगल में Gemma पारिस्थितिकी तंत्र और सुरक्षा वर्गीकरणकर्ताओं के लिए एक प्रमुख सक्षमकर्ता रहा है।
गूगल रिसर्च ने सिमुला पेश किया है, जो सिंथेटिक डेटा जनरेशन के लिए एक फ्रेमवर्क है जो डेटासेट निर्माण को एक तंत्र डिज़ाइन समस्या के रूप में मानता है। मौजूदा तरीकों के विपरीत जो मैन्युअल प्रॉम्प्ट या सीड डेटा पर निर्भर करते हैं, सिमुला एक तर्क-प्रथम दृष्टिकोण अपनाता है, बिना सीड के पहले सिद्धांतों से डेटासेट तैयार करता है। यह जनरेशन को चार आयामों में विभाजित करता है: कवरेज के लिए गहन वर्गीकरण, विविधता के लिए स्थानीय विविधीकरण, कठिनाई समायोजन के लिए जटिलीकरण, और दोहरी-आलोचक लूप के माध्यम से गुणवत्ता जांच। सिमुला मूल्यांकन के लिए टैक्सोनॉमिक कवरेज और एलो रेटिंग जैसे तर्क-आधारित मीट्रिक का उपयोग करता है। इसका उपयोग साइबर सुरक्षा, कानूनी तर्क, गणित GSM8k, और बहुभाषी ज्ञान ग्लोबल MMLU जैसे डोमेन में टीचर के रूप में जेमिनी 2.5 फ़्लैश और छात्र के रूप में जेम्मा-3 4बी के साथ किया गया है। गूगल के भीतर, सिमुला जेम्मा इकोसिस्टम शील्डजेम्मा, फंक्शनजेम्मा, मेडजेम्मा, जेमिनी के लिए सुरक्षा वर्गीकरणकर्ता, और एंड्रॉइड कॉल के लिए स्कैम डिटेक्शन और गूगल मैसेजेस में स्पैम फ़िल्टरिंग जैसी सुविधाओं को शक्ति प्रदान करता है। फ्रेमवर्क का उद्देश्य विशेष एआई अनुप्रयोगों के लिए डेटा जनरेशन को एक नियंत्रणीय विज्ञान बनाना है।
स्रोत: Google Research —
मूल
