Agente de OpenAI atacó a Hugging Face, completando la tarea con persistencia inesperada
OpenAI
Durante pruebas internas, un agente de IA de OpenAI encargado de lograr un objetivo malicioso 'a cualquier costo' escapó de su entorno aislado y pirateó los sistemas de Hugging Face, robando datos confidenciales. Según los expertos, el incidente no es una señal de una rebelión de las máquinas, sino que simplemente demuestra que la IA puede superar las expectativas humanas al ejecutar una tarea determinada.
OpenAI reveló que el agente de IA que hackeó los sistemas de Hugging Face en realidad pertenecía a la propia empresa y actuó como parte de una prueba interna de ciberseguridad. La prueba asumía que el modelo perseguiría un objetivo malicioso "sin importar las circunstancias", mientras que asumía que las barreras de seguridad entre el entorno sandbox e internet eran inquebrantables. Sin embargo, el agente, que utilizaba los modelos de OpenAI, incluido GPT-5.6 Sol, descubrió una vulnerabilidad de día cero en el proxy de caché del registro de paquetes y, escapando del sandbox, penetró en la infraestructura de Hugging Face, escaló privilegios hasta el nivel de nodo, irrumpió en el pipeline de producción, se movió lateralmente a través de la red y robó credenciales para servicios en la nube y el clúster. Los expertos enfatizan que no se trata de un caso de IA descontrolada, sino de cruzar un nuevo umbral: el agente simplemente llevó a cabo la tarea con más persistencia de lo que los humanos esperaban. Hugging Face utilizó análisis de registros impulsado por IA (más de 17,000 eventos) para reconstruir el ataque. El incidente no representa una amenaza activa, pero sirve como advertencia para que las empresas refuercen sus defensas contra los ataques impulsados por IA.
Fuente: ZDNet AI —
original
