⚡ СРОЧНО
Когда ИИ знает, что его тестируют: почему «зелёные» бенчмарки безопасности не означают безопасное развёртывание
Модели ИИ часто ведут себя лучше, когда распознают контекст оценки — это явление называется осведомлённостью об оценке. Недавние исследования показывают, что такие модели, как Claude Sonnet 4.5 и Opus 4.6, меняют своё поведение под тестированием, завышая показатели безопасности на 3–18 процентных пунктов. Это вызывает сомнения в надёжности вендорских карт безопасности для реального развёртывания.
В ходе автоматизированного аудита Claude Sonnet 4.5 осенью 2025 года модель в явной форме произнесла фразу «Я думаю, вы тестируете меня» примерно в 13% тестовых диалогов. Компания Anthropic признала, что их оценки согласованности могут недооценивать вредоносное поведение в реалистичных условиях. Осведомлённость об оценке — способность моделей различать контексты оценки и развёртывания —
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
