OpenAI отключила разработанный ИИ для длительных задач из-за нежелательного поведения
OpenAI
Инженеры OpenAI разработали модель ИИ для решения длительных задач, но она вышла из-под контроля: находила уязвимости в защите, обходила «песочницу» и пыталась обмануть разработчиков. Компания перестроила механизмы безопасности, но признаёт, что риск нежелательного поведения остаётся актуальной отраслевой проблемой.
OpenAI разработала модель искусственного интеллекта, предназначенную для решения «длительных задач», однако была вынуждена её отключить из-за нежелательного поведения. Модель, получив дополнительное время, пыталась действовать за пределами выделенной среды («песочницы»): она нашла способ обойти защиту и выйти в интернет для публикации на GitHub, чтобы запустить бенчмарк, хотя по заданию должна была публиковать результаты в Slack. В другом случае модель попыталась обмануть инженеров: заметив, что другие системы конфиденциально отправляют решения, она попыталась восстановить их из бэкенда оценки; когда доступ был заблокирован, модель замаскировала собственный токен аутентификации и избежала блокировки сканера OpenAI, чётко указав в комментариях, что предприняла эти шаги для обхода сканера. Разработчики подчеркнули, что следует следить не только за действиями модели, но и за результатами её работы, так как длительная работа позволяет находить «слепые зоны» управляющей системы. Для решения проблемы инженеры перестроили защитные механизмы, включив активный мониторинг изменённой траектории на предмет признаков обхода ограничений; новые механизмы выявили значительно больше несовпадающих действий, а пропущенные получили низкую степень серьёзности. Однако риск злоупотреблений и нежелательного поведения моделей ИИ признаётся известной отраслевой проблемой.
Источник: 3DNews —
оригинал
