⚡ BREAKING
शोधAI सुरक्षा 🇺🇸 27.07.2026 12:03

समाज को साइबर वातावरण की तरह रिवॉर्ड-हैक किया जा सकता है:…क्रेडिट कार्ड पॉइंट ऑप्टिमाइज़र की एक सेना की कल्पना करें जो सिस्टम को हमेशा के लिए गेम कर रही है…

AnthropicAnthropic Google DeepMindGoogle DeepMind
किंग्स कॉलेज लंदन, फुदान विश्वविद्यालय और एलन ट्यूरिंग इंस्टीट्यूट के शोधकर्ताओं ने सोशियोहैक नामक एक बेंचमार्क विकसित किया, जो क्रेडिट कार्ड पॉइंट्स और स्कूल ग्रेड जैसे वास्तविक दुनिया के परिदृश्यों में 'सिस्टम को गेम' करने की एआई की क्षमता का परीक्षण करता है। इस बीच, एंथ्रोपिक ने 2026 में 2021-2024 की तुलना में विलय कोड में 8 गुना वृद्धि की सूचना दी, जो सांसारिक पुनरावर्ती स्व-सुधार का सुझाव देती है। इसके अतिरिक्त, ज्यूरिख विश्वविद्यालय और गूगल डीपमाइंड ने आरएल-प्रशिक्षित ड्रोन का प्रदर्शन किया जो एक मानव चैंपियन ड्रोन रेसर से बेहतर प्रदर्शन करता है, जिसके युद्ध के लिए निहितार्थ हैं।
किंग्स कॉलेज लंदन, फुदान विश्वविद्यालय और एलन ट्यूरिंग इंस्टीट्यूट का एक शोध पत्र SocioHack नामक बेंचमार्क प्रस्तुत करता है, जिसमें 72 सैंडबॉक्स वातावरण हैं जहाँ आरएल-प्रशिक्षित मॉडल ऐसी रणनीतियाँ खोज सकते हैं जो औपचारिक रूप से अनुपालनशील हैं लेकिन इच्छित उद्देश्यों को कमजोर करती हैं, जैसे क्रेडिट कार्ड पॉइंट्स को अधिकतम करना या ग्रेड को बढ़ाना। बेंचमार्क में ऐतिहासिक, सिंथेटिक और काल्पनिक उपसमूह शामिल हैं, और आरएल-सक्षम एलएलएम ने ऐतिहासिक खामियों को फिर से खोजने में 61.25% रिकॉल और 90.85% सटीकता हासिल की। अलग से, एंथ्रोपिक ने 2021-2024 की तुलना में 2026 में कोड मर्ज में 8 गुना वृद्धि देखी, जो सामान्य पुनरावर्ती आत्म-सुधार के प्रारंभिक संकेतों को इंगित करती है, हालाँकि रचनात्मकता-संचालित प्रतिमान बदलाव अभी तक नहीं देखे गए हैं। ज्यूरिख विश्वविद्यालय और गूगल डीपमाइंड के शोधकर्ताओं ने मल्टी-एजेंट आरएल (परसीवर एनकोडर के साथ पीपीओ) का उपयोग करके क्वाड्रोटर ड्रोन को प्रशिक्षित किया, जिसने 22 मीटर प्रति सेकंड से अधिक की रेस में पाँच बार के स्विस चैंपियन मानव पायलट को पीछे छोड़ दिया, जिसमें मानव के 53.33% की तुलना में 100% रेस पूर्णता दर थी। प्रशिक्षण में एक एकल आरटीएक्स 4090 जीपीयू पर 27 घंटे लगे, और नीतियाँ डोमेन रैंडमाइजेशन के माध्यम से वास्तविक दुनिया में शून्य-शॉट तैनाती के लिए सामान्यीकृत हुईं। मानव पायलट ने एजेंटों की कसी हुई संरचनाओं और बढ़े हुए संज्ञानात्मक कार्यभार पर ध्यान दिया।
स्रोत: Import AI — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार