416 परीक्षण और 'सब नष्ट करें' बटन: जहां एजेंट प्रोजेक्ट विफल होते हैं
Anthropic
छह एजेंट प्रोजेक्ट्स के विश्लेषण से आवर्ती खामियां सामने आती हैं: सुरक्षा केवल पाठ के रूप में, बिना गेट के अपरिवर्तनीय क्रियाएं, और शून्य व्यवहारिक परीक्षण। यहां तक कि परिपक्व ओपन-सोर्स प्रोजेक्ट रिग्रेशन परीक्षणों के साथ भी अपरिवर्तनीय ईमेल भेजने के लिए सुरक्षा उपायों की कमी है। लेखक एजेंट सिस्टम की परिपक्वता का आकलन करने के लिए दस नैदानिक प्रश्न प्रस्तावित करते हैं।
लेखक फरवरी 2026 से क्लॉड कोड और --dangerously-skip-permissions के साथ एक रिसर्च लूप पर ग्राउंडहॉग (सुरोक) नामक एक ऑटोनॉमस एजेंट चला रहे हैं। फिर उन्होंने छह स्रोतों (जिसमें स्बेर का AI-DISRUPT PDLC पद्धति शामिल है) से बनी एक समग्र जांच सूची के खिलाफ अपने छह एजेंट प्रोजेक्ट्स का ऑडिट किया और तीन बार-बार होने वाले विफलता पैटर्न पाए: सुरक्षा केवल प्रॉम्प्ट में लागू की गई (मॉडल को ओवरराइड किया जा सकता है), बिना पुष्टि के अपरिवर्तनीय क्रियाएं (उदाहरण के लिए, एक रीबिल्ड कमांड सभी समृद्ध डेटा को मिटा देता है), और व्यवहारिक बग के लिए शून्य रिग्रेशन टेस्ट। लेखक ने एक अनाम बड़े ओपन-सोर्स एजेंट प्रोजेक्ट की भी समीक्षा की: इसमें कोड-स्तरीय अनुमति जांच और पिछले बग के लिए रिग्रेशन टेस्ट थे, लेकिन फिर भी बिना ड्राफ्ट या पुष्टि चरण के अपरिवर्तनीय रूप से ईमेल भेजे। एक नया ओपन-सोर्स फ्रेमवर्क (HarnessX) एक interrupt_on गेट प्रदान करता है लेकिन यह वैकल्पिक है और डिफ़ॉल्ट नहीं है। Sber का PDLC पद्धति कई लापता नियंत्रणों को औपचारिक बनाती है: पॉलिसी एज़ कोड, एवल्स एज़ कम्प्लीशन कॉन्ट्रैक्ट, और R3+ पर राज्य-बदलने वाले ऑपरेशनों के लिए अनिवार्य एबॉर्ट/रोलबैक के साथ एक R0–R5 अनुमति सीढ़ी। लेखक ने कुछ सीखे गए पाठों को लागू करते हुए एक सातवां प्रोजेक्ट बनाया: अब प्रत्येक रिलीज़ से पहले एवल्स चलाए जाते हैं और घटनाएं नामित रिग्रेशन टेस्ट बन जाती हैं।
स्रोत: Habr — хаб ИИ —
मूल
