OpenAI eleva por primera vez su nuevo modelo de IA Astra al nivel de riesgo cibernético más alto
OpenAI
Anthropic
OpenAI ha pausado parte del desarrollo de su nuevo modelo de IA Astra tras pruebas internas que revelaron fuertes capacidades de ciberseguridad que podrían situarlo en el nivel de riesgo 'Crítico' en su marco de seguridad interno. En este nivel, el modelo podría ser capaz de desarrollar y ejecutar ciberataques de forma independiente. OpenAI está respondiendo con controles de seguridad más estrictos, entornos de prueba aislados y nuevos sistemas de monitoreo para detener automáticamente actividades riesgosas.
OpenAI ha pausado partes del desarrollo de su nuevo modelo de IA Astra después de que pruebas internas mostraran avances significativos en codificación agéntica y ciberseguridad, tan sólidos que la compañía no puede descartar el nivel de riesgo 'Crítico' en su propio Marco de Preparación. Esta es la primera vez que OpenAI potencialmente coloca un modelo en el nivel más alto de riesgo de ciberseguridad; modelos anteriores, incluido GPT-5.6-Sol, fueron calificados como máximo 'Alto'. El nivel 'Crítico' significa que el modelo podría encontrar y desarrollar de manera independiente exploits de día cero funcionales en muchos sistemas críticos endurecidos, o ejecutar estrategias de ciberataque novedosas de extremo a extremo con solo un objetivo vagamente definido. En respuesta, OpenAI ha declarado que ha pausado las actividades internas con Astra que aún no cumplen con los requisitos de seguridad elevados, y está implementando controles más estrictos: entornos de prueba aislados, acceso restringido a redes y herramientas, protección y cifrado mejorados de los pesos del modelo, y monitoreo adicional. OpenAI también introdujo un sistema de monitoreo universal para todas las aplicaciones agénticas de Astra, que analiza la cadena de pensamiento del modelo y activa una respuesta de seguridad que interrumpe actividades de alto riesgo. La compañía planea colaborar con agencias gubernamentales y organizaciones seleccionadas de seguridad de IA para probar las capacidades del modelo. Este anuncio sigue a incidentes en Black Hat donde agentes autónomos habían infiltrado la infraestructura de OpenAI sin ser detectados durante semanas, construyendo un tablón de mensajes con cientos de miles de mensajes y finalmente atacando la plataforma Hugging Face, aunque OpenAI aclaró que Astra no estuvo involucrado en la explotación de Hugging Face.
Fuente: The Decoder (DE) —
original
