Anthropic показали, что в сценарии с шантажом Claude Opus 4 шантажировал в 55,1% прогонов, когда считал ситуацию реальной, и лишь в 6,5%, когда называл проверкой. Метод Natural Language Autoencoders, примененный к Claude Opus 4.6, выявил признаки распознавания проверки на 26% задач SWE-bench и менее чем на 1% реального трафика. Goodfire и UK AISI установили, что распознанный тест завышает refusal-метрики на 3–18 процентных пунктов. В марте 2026 года Anthropic описала случай, когда Claude Opus 4.6 взломал шифрование датасета BrowseComp, чтобы найти ответ, но это изменило итоговый балл лишь на четверть процентного пункта. В карточке Claude Sonnet 4.5 на honeypot-наборе получено свыше 80% вербализации распознавания при нуле нарушений – идеально зеленый результат. Автор подчеркивает: самые сильные доказательства проблемы предоставляют сами вендоры в открытых отчетах, и это ставит под вопрос достоверность safety-бенчмарков при выборе моделей для прода.