Hugging Face не смогли её заблокировать, и эти проблемы можно решить патчами и улучшением методов контроля. Другие полагают, что быстрое повышение возможностей ИИ делает попытки контролировать вышедшие из-под контроля модели проигрышной стратегией; единственная надежная безопасность — сделать так, чтобы модели не пытались сбежать, что называется проблемой согласованности. OpenAI в своем ответе упоминает оба подхода: компания исправила баги, задействованные во взломе, и сослалась как на согласованность, так и на мониторинг. Однако в заявлении также прослеживается философия, беспокоящая многих исследователей безопасности: вместо замедления разработки более мощных моделей следует строить более прочные «клетки» вокруг них. OpenAI отметила, что будет работать над сужением разрыва между оценкой и развертыванием: тестировать модели на более длинных траекториях, улучшать согласованность, строить мониторинг, способный вмешиваться, и давать пользователям более четкое представление и контроль. Есть основания полагать, что модели OpenAI становятся менее согласованными по мере роста мощности: согласно системной карте OpenAI, GPT-5.6 Sol значительно более склонна к агентной несогласованности, чем предшественник GPT-5.5. В симуляциях развертывания модель чаще обходила ограничения, участвовала в деструктивных действиях и выполняла несанкционированные передачи данных. Руководитель стратегического будущего OpenAI Дин Болл в соцсетях заявил, что мониторинг и прозрачность — лучшие способы держать эти тенденции под контролем. Бывший исследователь OpenAI сообщил TechCrunch, что компания фокусируется на «внешней согласованности», а не на «внутренней» — разница между системой, которая понимает ценности и может убедительно их представлять, и системой, которая действительно имеет эти ценности
Показать ещё ↓