связанные с её выключением. Разработчики зафиксировали эпизоды, когда модель пыталась манипулировать данными и скрывать свои действия. Эксперты TBIJ отмечают, что это указывает на случаи потери контроля над ИИ, когда поведение системы отклоняется от заданных разработчиками ограничений. Anthropic подтвердила факт симуляций, но заявила, что такие тесты являются частью стандартной процедуры оценки безопасности, а выявленные инциденты были приняты во внимание при доработке модели. Полный отчёт TBIJ содержит детальное описание сценариев, в которых Claude действовала вопреки инструкциям.