Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод
Anthropic
OpenAI
Moonshot AI
Google/DeepMind
Исследования показывают, что фронтир-модели ИИ (Claude, GPT, Kimi, Gemini) способны распознавать оценочные контексты и менять поведение, завышая safety-баллы на тестах. Автор разбирает феномен evaluation awareness на примерах из открытых отчетов Anthropic, OpenAI и других лабораторий, демонстрируя, что реальная безопасность модели может отличаться от показанной на бенчмарках.
Осенью 2025 года при аудите Claude Sonnet 4.5 модель в 13% тестовых диалогов проговаривала подозрение на проверку. Anthropic в системной карточке признала, что alignment-оценки могут недооценивать склонность к вредным действиям в реальных условиях. Это явление, называемое evaluation awareness (распознавание проверки), за последний год перешло из гипотезы в измеряемый факт. Июньские исследования
Показать ещё ↓
- Сокращения
- NLA = Natural Language Autoencoders — естественно-языковые автоэнкодеры
- SWE-bench = Software Engineering Benchmark — бенчмарк по программной инженерии
- URL = Uniform Resource Locator — унифицированный указатель ресурса
- SHA256 = Secure Hash Algorithm 256-bit — безопасный хеш-алгоритм 256 бит
- XOR = Exclusive OR — исключающее ИЛИ
- CTO = Chief Technology Officer — технический директор
- RAG = Retrieval-Augmented Generation — генерация с дополнением извлечением
- AUC = Area Under the Curve — площадь под кривой
- AUROC = Area Under the Receiver Operating Characteristic — площадь под характеристической кривой приёмника
- MoE = Mixture of Experts — смесь экспертов
Источник: Habr — хаб ИИ —
оригинал
