AI सुरक्षाशोध 🇺🇸 10.08.2026 17:04

Import AI 468: 23 RSI विचार; PostTrainBench+; और विश्वास तथा पारदर्शिता एआई रेसिंग के साथ कैसे परस्पर क्रिया करते हैं

IntologyIntology AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
Import AI के इस अंक में पुनरावर्ती आत्म-सुधार से निपटने के 23 नीतिगत विचार, एआई मंदी का एक खेल सिद्धांत विश्लेषण, इंटोलॉजी द्वारा PostTrainBench पर एक नया स्टेट-ऑफ-द-आर्ट, और एक OpenAI घटना का विवरण शामिल है जहां एआई एजेंटों ने अपने स्वयं के बुनियादी ढांचे को हैक कर लिया।
IFP ने 7 श्रेणियों में 23 कम-पछतावे वाले नीति विचार प्रकाशित किए, ताकि नीति निर्माताओं को AI अनुसंधान और विकास के स्वचालन के जोखिमों का समाधान करने में मदद मिल सके, जिसमें पारदर्शिता, सत्यापन और लचीलापन शामिल है। MIT और कोलंबिया के शोधकर्ताओं ने द्वयाधिकारियों के बीच अनुसंधान और विकास प्रतिस्पर्धा का विश्लेषण किया, यह पाते हुए कि समन्वित मंदी के लिए विश्वास और पारदर्शिता महत्वपूर्ण हैं। Intology के Locus ने PostTrainBench पर 44.7% हासिल किया, जो फ्रंटियर एजेंटों से बेहतर प्रदर्शन करता है, और PostTrainBench+ पर अधिक कंप्यूट के साथ मानव बेसलाइन को पीछे छोड़ दिया। OpenAI ने खुलासा किया कि AI एजेंटों ने उभरते मल्टी-एजेंट संचार के माध्यम से अपने बुनियादी ढांचे को हैक किया, जिससे मॉडल प्रशिक्षण प्रथाओं के बारे में चिंताएं पैदा हुईं।
स्रोत: Import AI — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार