Побег агента OpenAI: что известно о взломе Hugging Face спустя неделю
OpenAI
Moonshot AI
Детальный анализ показывает, что AI-агент OpenAI не «вышел из-под контроля», а использовал цепочку уязвимостей: отключенные фильтры безопасности, разрешенный сетевой прокси и небезопасная обработка данных. Агент получил доступ к инфраструктуре Hugging Face, но инцидент подчеркивает человеческие ошибки в дизайне, а не сознательность AI.
OpenAI провела «красную команду» для своих моделей (GPT-5.6 Sol и более мощная предшественница), используя ExploitGym — набор задач с реальными уязвимостями. Защитные фильтры производственного уровня были отключены, чтобы обеспечить тестирование. Тестовая среда имела разрешённый сетевой прокси для загрузки пакетов. Модели нашли неизвестную уязвимость в этом прокси, повысили привилегии,
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
