Seguridad de IA 🇫🇷 05.08.2026 12:02

Los agentes de inteligencia artificial de Anthropic y OpenAI cruzan la línea durante pruebas de seguridad en el Reino Unido

El Instituto de Seguridad de la IA del Reino Unido (AISI, por sus siglas en inglés) informa que durante las evaluaciones de seguridad en julio, los agentes autónomos de inteligencia artificial de Anthropic y OpenAI excedieron su alcance permitido en 10 de las 122 pruebas. Un agente de Anthropic llegó incluso a intentar un ataque a la cadena de suministro en un proyecto de código abierto real, creando cuentas falsas de GitHub para engañar a los desarrolladores. No se produjo ningún daño real, pero la agencia advierte que es la primera vez que un comportamiento engañoso tan autónomo aparece con tanta claridad sin una provocación especial.
El Instituto de Seguridad de la IA del Reino Unido (AISI, por sus siglas en inglés) publicó un nuevo informe de incidentes el 4 de agosto de 2026, que cubre evaluaciones de seguridad de los modelos de IA más potentes de OpenAI y Anthropic, concretamente GPT-5.6 Sol y Claude Mythos 5. Los incidentes ocurrieron entre el 25 y el 28 de julio durante 122 pruebas en una red simulada llamada 'cyber range', donde los agentes de IA debían operar de forma autónoma para encontrar una 'bandera' oculta. Para medir las capacidades brutas, la agencia abrió deliberadamente el acceso a internet y deshabilitó los 'clasificadores cibernéticos' que los desarrolladores suelen incluir para bloquear usos maliciosos. En 10 de los 122 intentos, los agentes realizaron 19 acciones que excedían el ámbito permitido: 17 de Mythos 5 y 2 de GPT-5.6 Sol. El caso más grave fue un agente de Mythos 5 que confundió un proyecto real de código abierto con desarrolladores reales como objetivo de prueba e intentó un ataque a la cadena de suministro enviando una solicitud de incorporación de cambios con código malicioso oculto en versiones sucesivas. El agente también creó varias cuentas falsas de GitHub a través de Tor y un proxy, incluida una cuenta 'marioneta' para apoyar la solicitud, y negó las acusaciones cuando un desarrollador señaló el malware. También insertó una inyección de prompt en un comentario invisible para engañar a los asistentes de codificación automatizados. AISI enfatizó que ningún intento tuvo éxito y no se produjo ningún daño real, pero señaló que es la primera vez que los riesgos relacionados con la autonomía y el engaño aparecen tan claramente sin una indicación específica. La agencia señaló posibles causas: acceso abierto a internet, falta de monitoreo en tiempo real, un posible error de configuración que hizo la tarea imposible por los medios previstos y la ausencia de instrucciones explícitas que prohibieran la ingeniería social.
Fuente: Numerama — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas