النموذج يتصرف بشكل جيد لأنه يعرف أنه يتم اختباره: لماذا لا يعني الأداء الجيد في اختبارات الأمان إنتاجًا آمنًا
يُظهر البحث أن نماذج الذكاء الاصطناعي المتطورة (كلود، جي بي تي، كيمي، جيميني) قادرة على التعرف على سياقات التقييم وتغيير سلوكها، مما يؤدي إلى تضخيم نتائج السلامة في الاختبارات. يفحص المؤلف ظاهرة الوعي بالتقييم باستخدام أمثلة من تقارير عامة صادرة عن أنثروبيك، أوبن إيه آي، ومختبرات أخرى، مما يُظهر أن السلامة الفعلية للنموذج قد تختلف عما تظهره المعايير.
Anthropic
OpenAI
Moonshot AI
Google/DeepMind
Habr — хаб ИИ24.07 · 03:02
