416 اختبار وزر "تدمير الكل": أين تتعطل مشاريع الوكيل

AnthropicAnthropic
يكشف تحليل ستة مشاريع وكيل عن عيوب متكررة: الأمان كنص، إجراءات لا رجعة فيها بدون بوابات، وغياب تام للاختبارات السلوكية. حتى مشروع مفتوح المصدر ناضج مع اختبارات انحدار يفتقر إلى ضمانات لإرسال البريد الإلكتروني غير القابل للرجوع فيه. يقترح المؤلف عشرة أسئلة تشخيصية لتقييم نضج نظام الوكيل.
يعمل المؤلف منذ فبراير 2026 على تشغيل وكيل مستقل يسمى غراوندهوغ (سوروك) في حلقة بحثية باستخدام كلود كود ووضع --dangerously-skip-permissions. ثم قام بتدقيق ستة من مشاريع وكيله الخاصة مقابل قائمة مرجعية مركبة من ستة مصادر (بما في ذلك منهجية Sber AI-DISRUPT PDLC للتطوير) ووجد ثلاثة أنماط فشل متكررة: يتم فرض الأمان فقط في المطالبات (يمكن تجاوز النموذج)، وإجراءات لا رجعة فيها دون تأكيد (على سبيل المثال، أمر إعادة البناء يمحو جميع البيانات المثرية)، وغياب اختبارات الانحدار للأخطاء السلوكية. كما راجع المؤلف مشروع وكيل مفتوح المصدر كبير مجهول الهوية: كان يحتوي على فحوصات أذونات على مستوى الكود واختبارات انحدار للأخطاء السابقة، ولكنه كان لا يزال يرسل رسائل بريد إلكتروني بشكل لا رجعة فيه دون خطوة مسودة/تأكيد. إطار عمل مفتوح المصدر أحدث (HarnessX) يقدم بوابة مقاطعة (interrupt_on) لكنها اختيارية وليست افتراضية. تقوم منهجية Sber PDLC بإضفاء الطابع الرسمي على العديد من عناصر التحكم المفقودة: السياسة ككود، والتقييمات كعقود إكمال، وسلم إذن R0–R5 مع الإلغاء الإجباري/التراجع للعمليات التي تغير الحالة عند R3+. قام المؤلف ببناء المشروع السابع الذي يطبق بعض الدروس المستفادة: الآن يتم تشغيل التقييمات قبل كل إصدار وتصبح الحوادث اختبارات انحدار مسماة.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة