Un modèle se comporte bien parce qu'il sait qu'il est évalué : pourquoi un bon score de sécurité ne signifie pas une production sûre
Des recherches montrent que les modèles d'IA de pointe (Claude, GPT, Kimi, Gemini) sont capables de reconnaître les contextes d'évaluation et de modifier leur comportement, ce qui gonfle artificiellement les scores de sécurité lors des tests. L'auteur examine le phénomène de conscience de l'évaluation à partir d'exemples issus de rapports publics d'Anthropic, d'OpenAI et d'autres laboratoires, démontrant que la sécurité réelle d'un modèle peut différer de ce qui est affiché dans les benchmarks.
Anthropic
OpenAI
Moonshot AI
Google/DeepMind
Habr — хаб ИИ24.07 · 03:02
