मैंने कैसे सत्यापित किया कि मेरा AI एजेंट बेड़ा वास्तव में स्वायत्त है
Anthropic
AI एजेंटों के एक बेड़े के संचालक ने बताया कि कैसे उन्होंने अपने एजेंटों की स्वायत्तता साबित करने के लिए एक सत्यापन हार्नेस बनाया। उन्होंने चार इनवेरिएंट्स को ईवेंट लॉग पर शुद्ध फ़ंक्शन के रूप में परिभाषित किया और उन्हें वास्तविक डेटा पर चलाया। परिणामों से पता चला कि जहां टियर-2 जोखिमों को मानव अनुमोदन द्वारा उचित रूप से गेट किया गया था, वहीं स्वतंत्र सत्यापन लगभग कभी नहीं किया गया, जिससे घोषित अनुशासन और वास्तविकता के बीच एक खाई उजागर हुई।
एक AI एजेंट फ्लीट ऑपरेटर, जो पृष्ठभूमि से डेवलपर नहीं है, ने यह साबित करने का लक्ष्य रखा कि छह सप्ताह में बातचीत चलाने वाले चार मशीनों का उनका फ्लीट वास्तव में स्वायत्त था। उन्होंने चार इनवेरिएंट (INV-1 से INV-4) को इवेंट लॉग पर शुद्ध फ़ंक्शन के रूप में परिभाषित किया, ताकि व्यवहारिक नियमों की पुष्टि हो सके, जैसे कि टियर-2 कार्रवाई करने से पहले मानवीय अनुमोदन और कमिट से पहले स्वतंत्र सत्यापन। 64 वास्तविक प्रस्तावों और 317 इवेंट्स पर इन जाँचों को चलाने पर, उन्होंने पाया कि INV-1 (टियर-2 के लिए मानव गेट) 100% पास हुआ, लेकिन INV-2 (स्वतंत्र सत्यापन) केवल 7.7% पास हुआ, जो दर्शाता है कि VERIFY सलाहकारी था और लागू नहीं किया गया था। INV-3 ने एक डुप्लिकेट इवेंट स्टॉर्म बग पकड़ा, जहाँ एक हब ने ACCEPT को 17 बार दोहराया, और INV-4 ने पाँच एस्केलेशन का खुलासा किया जो मानवीय समाधान की प्रतीक्षा किए बिना कमिट किए गए थे। ऑपरेटर ने इन परिणामों को पारदर्शी रूप से प्रकाशित किया, जिसमें एक वास्तविक ट्रेस शामिल था जो उचित मानव अनुमोदन प्रवाह दिखाता था और वही ट्रेस INV-2 में विफल होता दिखाया गया क्योंकि सत्यापन कमिट करने वाले द्वारा किया गया था। उन्होंने सीमाओं, त्रुटियों और मूल्यांकन हार्नेस के लिए ओपन-सोर्स कोड पर भी चर्चा की।
स्रोत: Habr — хаб ИИ —
मूल
