كيف تحققت من أن أسطول وكلاء الذكاء الاصطناعي لدي مستقل حقًا

AnthropicAnthropic
يصف مشغّل أسطول من وكلاء الذكاء الاصطناعي كيفية بناء إطار تحقق لإثبات استقلالية وكلائه. حدّد أربعة ثوابت كدوال نقية على سجلات الأحداث وشغّلها على بيانات حقيقية. أظهرت النتائج أنه بينما كانت المخاطر من المستوى الثاني محمية بشكل صحيح بموافقة بشرية، لم يتم إجراء التحقق المستقل تقريبًا أبدًا، مما كشف فجوة بين الانضباط المُعلن والواقع.
مشغل أسطول وكلاء ذكاء اصطناعي، ليس مطورًا من حيث الخلفية، عزم على إثبات أن أسطوله المكون من أربعة أجهزة التي تدير المفاوضات على مدى ستة أسابيع كان مستقلًا حقًا. لقد عرّفوا أربع خصائص ثابتة (INV-1 إلى INV-4) كدوال صرفة على سجلات الأحداث للتحقق من قواعد سلوكية مثل موافقة الإنسان قبل تنفيذ إجراءات من المستوى الثاني والتحقق المستقل قبل الالتزام. عند تشغيل هذه الفحوصات على 64 مقترحًا حقيقيًا و317 حدثًا، وجدوا أن INV-1 (بوابة الإنسان للمستوى الثاني) اجتاز بنسبة 100%، لكن INV-2 (التحقق المستقل) فقط 7.7%، مما يشير إلى أن التحقق كان استشاريًا وليس إلزاميًا. اكتشف INV-3 خطأ انفجار الأحداث المكررة حيث كرر المحور قبولًا 17 مرة، وكشف INV-4 عن خمس تصعيدات تم الالتزام بها دون انتظار حل بشري. نشر المشغل هذه النتائج بشفافية، بما في ذلك تتبع حقيقي يُظهر مسار موافقة بشرية سليمًا ونفس التتبع يفشل في INV-2 لأن التحقق تم بواسطة المُلتزِم. كما ناقشوا القيود والأخطاء والتعليمات البرمجية مفتوحة المصدر لأداة التقييم.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة