416 परीक्षण और 'सब नष्ट करें' बटन: एजेंट प्रोजेक्ट कहाँ टूटते हैं
Anthropic
छह एजेंट प्रोजेक्टों के विश्लेषण में बार-बार खामियाँ सामने आईं: सुरक्षा को केवल पाठ के रूप में लागू करना, बिना गेट के अपरिवर्तनीय कार्रवाइयाँ, और शून्य व्यवहार परीक्षण। यहाँ तक कि एक परिपक्व ओपन-सोर्स प्रोजेक्ट, जिसमें रिग्रेशन टेस्ट हैं, में भी अपरिवर्तनीय ईमेल भेजने के लिए सुरक्षा उपायों का अभाव है। लेखक एजेंट सिस्टम की परिपक्वता का आकलन करने के लिए दस नैदानिक प्रश्न प्रस्तावित करता है।
लेखक फरवरी 2026 से क्लॉड कोड और --dangerously-skip-permissions के साथ एक रिसर्च लूप पर ग्राउंडहॉग (सुरोक) नामक एक ऑटोनॉमस एजेंट चला रहे हैं। फिर उन्होंने छह स्रोतों (जिसमें स्बेर का AI-DISRUPT PDLC पद्धति शामिल है) से बनी एक समग्र जांच सूची के खिलाफ अपने छह एजेंट प्रोजेक्ट्स का ऑडिट किया और तीन बार-बार होने वाले विफलता पैटर्न पाए: सुरक्षा केवल प्रॉम्प्ट में लागू की गई (मॉडल को ओवरराइड किया जा सकता है), बिना पुष्टि के अपरिवर्तनीय क्रियाएं (उदाहरण के लिए, एक रीबिल्ड कमांड सभी समृद्ध डेटा को मिटा देता है), और व्यवहारिक बग के लिए शून्य रिग्रेशन टेस्ट। लेखक ने एक अनाम बड़े ओपन-सोर्स एजेंट प्रोजेक्ट की भी समीक्षा की: इसमें कोड-स्तरीय अनुमति जांच और पिछले बग के लिए रिग्रेशन टेस्ट थे, लेकिन फिर भी बिना ड्राफ्ट या पुष्टि चरण के अपरिवर्तनीय रूप से ईमेल भेजे। एक नया ओपन-सोर्स फ्रेमवर्क (HarnessX) एक interrupt_on गेट प्रदान करता है लेकिन यह वैकल्पिक है और डिफ़ॉल्ट नहीं है। Sber का PDLC पद्धति कई लापता नियंत्रणों को औपचारिक बनाती है: पॉलिसी एज़ कोड, एवल्स एज़ कम्प्लीशन कॉन्ट्रैक्ट, और R3+ पर राज्य-बदलने वाले ऑपरेशनों के लिए अनिवार्य एबॉर्ट/रोलबैक के साथ एक R0–R5 अनुमति सीढ़ी। लेखक ने कुछ सीखे गए पाठों को लागू करते हुए एक सातवां प्रोजेक्ट बनाया: अब प्रत्येक रिलीज़ से पहले एवल्स चलाए जाते हैं और घटनाएं नामित रिग्रेशन टेस्ट बन जाती हैं।
स्रोत: Habr — хаб ИИ —
मूल
