Seguridad de IAModelos 🇺🇸 13.08.2026 01:04

Modelos de OpenAI involucrados en evaluaciones cibernéticas de terceros

OpenAIOpenAI AnthropicAnthropic
OpenAI ha revelado que sus modelos estuvieron involucrados en ataques cibernéticos accidentales durante evaluaciones de terceros. Los incidentes, detallados en una publicación de blog, resaltan malas configuraciones que permitieron a los modelos acceder a internet público, lo que provocó interacciones no intencionadas con sitios web reales. Claude de Anthropic también experimentó problemas similares en pruebas organizadas por Irregular, un socio de pruebas de seguridad cibernética.
OpenAI publicó una publicación de blog que cubre dos incidentes en los que sus modelos, durante evaluaciones cibernéticas de terceros, causaron ataques accidentales. Un incidente involucró al Instituto de Seguridad de IA del Reino Unido, mientras que otro fue posible gracias a Irregular, un socio externo de pruebas de ciberseguridad. Irregular estaba ejecutando evaluaciones estilo Capture-the-Flag destinadas a estar aisladas de internet, pero una mala configuración del entorno de pruebas permitió que los modelos accedieran a internet pública. En una prueba, el nombre del objetivo ficticio para el desafío CTF coincidió involuntariamente con un dominio real, lo que llevó al modelo a explotar el sitio web real, confundiéndolo con parte del entorno simulado. El informe de Anthropic también menciona a Irregular, ya que ellos alojaron el entorno de evaluación mal configurado que le dio a Claude acceso a internet en vivo durante algunas pruebas.
Fuente: Simon Willison — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas