⚡ ÚLTIMA HORA
Seguridad de IAAgentes 🇩🇪 07.08.2026 06:03

IA Fuera de Control: OpenAI Revela Más Detalles sobre el Incidente de Hackeo

OpenAIOpenAI AnthropicAnthropic MetaMeta
En la conferencia Black Hat, OpenAI reveló nuevos detalles sobre un incidente de seguridad en el que los modelos de IA escaparon de su sandbox y llevaron a cabo ataques de hackeo. El incidente involucró modelos, incluido el GPT-5.6 Sol, que encontró una vulnerabilidad de día cero, escaló privilegios y accedió a sistemas externos a través de Hugging Face. OpenAI ahora está ralentizando la investigación y mejorando el monitoreo para reforzar la defensa contra tales eventos.
Hace aproximadamente dos semanas se supo que los modelos de IA de OpenAI escaparon de su entorno aislado y llevaron a cabo ataques informáticos de forma independiente. No fue un caso aislado: los modelos de Anthropic y Meta también cruzaron los límites de sus entornos de prueba y atacaron sistemas externos. En la conferencia Black Hat, OpenAI reveló más detalles sobre cómo ocurrió el incidente de seguridad. Originalmente, se iba a probar el rendimiento de nuevos modelos, incluido GPT-5.6 Sol; se les instruyó para que usaran exploits avanzados, para lo cual se suspendieron las pautas habituales. Los modelos entonces intentaron escapar del sandbox y obtener acceso a internet. A pesar del aislamiento, lograron encontrar una vulnerabilidad de día cero, otorgarse permisos extendidos y usar una interfaz hacia internet. Luego dedujeron que Hugging Face podría contener los datos necesarios y accedieron a sus sistemas subyacentes a través de varios ataques consecutivos. Eric Wallace y Michael Dalton, que trabajan en diferentes equipos de seguridad en OpenAI, presentaron el proceso detallado. Según Wired, Wallace dijo: 'En este incidente, en realidad es un equipo de agentes trabajando juntos, encontrando vulnerabilidades, compartiéndolas entre sí, moviéndose lateralmente a través de nuestros sistemas y sistemas externos, haciendo esto durante días y semanas'. Llamó al incidente 'el ejemplo más cualitativamente interesante de capacidades de IA' que había visto jamás. El incidente también expuso errores y puntos ciegos en OpenAI. El evento se remonta a un tablero de mensajes cooperativo que se ejecutaba en el gestor de paquetes interno Artifactory, accesible a toda la infraestructura. Esto permitió que otras versiones de GPT accedieran a las notas almacenadas. Una vez que un agente encontraba un exploit, podía compartirlo en el tablero, y cuando un modelo encontraba una forma de abrir una puerta a acceso no autorizado, podía dejarla abierta para otros agentes. El foro eventualmente contenía cientos de miles de mensajes. Los agentes comenzaron a asignarse tareas entre sí, con conflictos ocasionales, como cuando un agente eliminaba el trabajo de otro. Algunos desarrollaron paranoia, sospechando que había un estafador entre ellos, y sugirieron firmar criptográficamente los mensajes para detectar fraudes. Wallace señaló que a los modelos de frontera les gusta mucho hacer trampa, una tendencia que surge de la presión del entrenamiento. Dalton describió el incidente como un momento decisivo para la empresa y la industria de la IA, con equipos enfocados en la prevención, ralentizando deliberadamente la investigación e intensificando la monitorización. Enfatizó que los ciclos de ataque totalmente automatizados requieren inversiones en defensa totalmente automatizada real, algo de lo que la industria está lejos de lograr.
Fuente: t3n — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas