Science One Framework: चेन-ऑफ-एविडेंस के माध्यम से सत्यापन योग्य स्वायत्त अनुसंधान ढांचा
Google/DeepMind
Sakana AI
Google Research ने Science One Framework पेश किया, जो एक स्वायत्त अनुसंधान प्रोटोटाइप है जो सत्यापन योग्य साक्ष्य श्रृंखलाओं के निर्माण द्वारा भ्रम को समाप्त करता है, और CoE Audit, एक स्वचालित प्रोटोकॉल जो एआई-जनित पेपर्स की अखंडता का मूल्यांकन करता है। परिणाम दिखाते हैं कि Science One शून्य फैंटम संदर्भ और पूरी तरह से सत्यापन योग्य स्कोर प्राप्त करता है, जबकि बेंचमार्क पर मानव विशेषज्ञ प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करता है।
Google Research ने Science One Framework पेश किया है, जो एक स्वायत्त शोध प्रोटोटाइप है जो मूल रूप से सत्यापन योग्य साक्ष्य श्रृंखलाएँ बनाकर भ्रम (hallucinations) को समाप्त करने के लिए डिज़ाइन किया गया है, साथ ही CoE Audit, एक स्वचालित प्रोटोकॉल है जो AI-जनित पेपरों की अखंडता का मूल्यांकन करता है। यह ढाँचा Chain-of-Evidence (CoE) पर आधारित है, जो एक नई सत्यापनीयता अवधारणा है जिसके लिए आवश्यक है कि किसी शोध कृति में प्रत्येक दावे के लिए एक रिकॉर्डेड साक्ष्य श्रृंखला हो (पूर्णता) और प्रत्येक श्रृंखला वास्तव में दावे का समर्थन करे (सत्यता)। Science One Framework, CoE को तीन मुख्य मॉड्यूलों के माध्यम से कार्यान्वित करता है: एक Idea Explorer, एक Problem Investigator, और एक Solution Developer। CoE Audit चार कठोर अखंडता जाँचें लागू करता है: संदर्भ सत्यापन, स्कोर सत्यापन, कोड प्रतिलिपि, और विधि-कोड संरेखण। ADRS बेंचमार्क के 75 पेपरों पर मूल्यांकन में, Science One ने 21% तक की आधारभूत भ्रम दरों की तुलना में शून्य प्रेत संदर्भ प्राप्त किए, पूर्ण स्कोर सत्यापन, और उच्चतम विधि-कोड संरेखण, जबकि सभी पाँच ADRS कार्यों पर मानव विशेषज्ञ प्रदर्शन को प्रतिद्वंद्विता दी या उससे अधिक किया। इस ढाँचे का परीक्षण MLE-Bench और Parameter-Golf सहित छह बाहरी जटिल कार्यों पर भी किया गया, जिसमें अत्याधुनिक परिणाम प्राप्त हुए।
स्रोत: Google Research —
मूल
