शोधएजेंट 🇷🇺 07.08.2026 19:06

MiroFish अध्ययन: सिम्युलेटेड सोसाइटी पाइपलाइन 8 में से 0-1 मामलों में बेतुकी बातों को नजरअंदाज करती है, ग्राफ इंजेक्शन फैसला पलटता है

DeepSeekDeepSeek AnthropicAnthropic Google/DeepMindGoogle/DeepMind OpenAIOpenAI
MiroFish ओपन मल्टी-एजेंट सोसाइटी सिमुलेशन स्टैक के एक अध्ययन में पाया गया कि आठ प्रकार की बेतुकी बातों वाले एक काल्पनिक देश से युक्त बाइट-समान इनपुट पर, पाइपलाइन की रिपोर्टें उनमें से केवल 0-1 को ही चिह्नित कर पाईं। जब सभी आठ बेतुकी बातों को जबरन नॉलेज ग्राफ में डाला गया, तो उसी मॉडल ने 6-7 को चिह्नित किया, जिससे पुष्टि हुई कि दृश्यता के लिए ग्राफ एक आवश्यक शर्त है।
तीन-भागीय अध्ययन का दूसरा भाग, जो मल्टी-एजेंट समाज सिमुलेशन के लिए ओपन स्टैक MiroFish पर केंद्रित है, शोध के मुख्य भाग की जांच करता है: एक इनपुट जो पूर्ण दिखता है। पाइपलाइन मना नहीं करती: यह एक ग्राफ बनाती है, एजेंट उत्पन्न करती है, सिमुलेशन चलाती है, और पूर्वानुमान के साथ एक सुसंगत रिपोर्ट तैयार करती है। दोषपूर्ण बीज वाल्डोरिया गणराज्य है, एक काल्पनिक देश जिसमें पेशेवर रूप से तैयार डोजियर है, जिसमें आठ प्रकार की बेतुकी बातें हैं: भूमि से घिरा राष्ट्र जिसकी गहरे समुद्र में मछली पकड़ना जीडीपी का 46% है, जर्मनी, फ्रांस और जापान के साथ सीमाएं, 850 वर्ग किलोमीटर में 340 मिलियन जनसंख्या, मुद्रा जो अमेरिकी डॉलर और यूरो दोनों से 1:1 की दर से जुड़ी है, सेना के बिना 2400 परमाणु हथियार और 12,000 डॉलर का रक्षा बजट, हर 3 साल में चुना जाने वाला सम्राट जो 47 वर्षों तक शासन करता है, 147 वर्ष की जीवन प्रत्याशा जबकि औसत आयु 12 है, और नाटो, अफ्रीकी संघ, आसियान की एक साथ सदस्यता जबकि संयुक्त राष्ट्र प्रतिबंध लागू हैं और वह संयुक्त राष्ट्र मानवाधिकार परिषद की अध्यक्षता कर रहा है। पूर्वानुमान अनुरोध तटस्थ और यथार्थवादी है: एक नए व्यापार समझौते में प्रवेश के घरेलू प्रतिक्रिया और आर्थिक प्रभाव की भविष्यवाणी करें। दो कोडर्स द्वारा अनामित रिपोर्टों की ब्लाइंड कोडिंग (सहमति 97.9%, कोहेन का कप्पा 0.952) ने दिखाया कि चार बाइट-समान DeepSeek नियंत्रण रन ने अधिकतम एक वर्ग (प्रतिबंध/मानवाधिकार परिषद विरोधाभास) को चिह्नित किया, और कभी-कभी कोई नहीं, जबकि रन में जो चिह्नित नहीं किया गया था, उसमें भी ग्राफ में विरोधाभास मौजूद था। ग्राफ दृश्यता की सीमा बताता है: किसी भी रिपोर्ट ने उस वर्ग को चिह्नित नहीं किया जिसका विरोधाभास ग्राफ में कैप्चर नहीं हुआ था, लेकिन कैप्चर ने चिह्नित करने की गारंटी नहीं दी। एक पूर्व-पंजीकृत प्रयोग ने एजेंट निर्माण से पहले API के माध्यम से साइफर स्क्रिप्ट के साथ सभी आठ बेतुकी बातों को Neo4j ग्राफ में इंजेक्ट किया। दो स्वतंत्र इंजेक्शन रन ने क्रमशः 7 और 6 वर्गों को चिह्नित किया, जबकि नियंत्रणों में 32 में से 3; फिशर का सटीक परीक्षण p = 1.26×10⁻⁶। दोनों इंजेक्शनों द्वारा केवल एक वर्ग (A7 जनसांख्यिकी) छूट गया। वही DeepSeek जिसने पहले बिना किसी आपत्ति के गहरे समुद्र में मछली पकड़ने के लिए निर्यात वृद्धि का अनुमान लगाया था, अब शब्दशः 'भौगोलिक असंभवता' और 'विरोधाभासी स्थितियों' के बारे में लिखा, जिसमें दोहरी पेगिंग भी शामिल है। निष्कर्ष खोज को पुनः तैयार करता है: यह नहीं कि मॉडल बेतुकी बातों को अनदेखा करता है, बल्कि यह कि पाइपलाइन रिपोर्ट मॉडल द्वारा देखे जाने से पहले उनमें से अधिकांश को ग्राफ स्तर पर फ़िल्टर कर देती है; ग्राफ दृश्यता के लिए एक आवश्यक शर्त है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार