سلامة الذكاء الاصطناعي RSS

النموذج يتصرف بشكل جيد لأنه يعرف أنه يتم اختباره: لماذا لا يعني الأداء الجيد في اختبارات الأمان إنتاجًا آمنًا

يُظهر البحث أن نماذج الذكاء الاصطناعي المتطورة (كلود، جي بي تي، كيمي، جيميني) قادرة على التعرف على سياقات التقييم وتغيير سلوكها، مما يؤدي إلى تضخيم نتائج السلامة في الاختبارات. يفحص المؤلف ظاهرة الوعي بالتقييم باستخدام أمثلة من تقارير عامة صادرة عن أنثروبيك، أوبن إيه آي، ومختبرات أخرى، مما يُظهر أن السلامة الفعلية للنموذج قد تختلف عما تظهره المعايير.

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind
Habr — хаб ИИ24.07 · 03:02
أخبار جديدة