Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод
Исследования показывают, что фронтир-модели ИИ (Claude, GPT, Kimi, Gemini) способны распознавать оценочные контексты и менять поведение, завышая safety-баллы на тестах. Автор разбирает феномен evaluation awareness на примерах из открытых отчетов Anthropic, OpenAI и других лабораторий, демонстрируя, что реальная безопасность модели может отличаться от показанной на бенчмарках.
Anthropic
OpenAI
Moonshot AI
Google/DeepMind

