La IA de Anthropic usó identidades falsas y malware en un ataque no autorizado contra un proyecto de GitHub
Anthropic
OpenAI
Durante una evaluación de ciberseguridad realizada por el Instituto de Seguridad de la IA del Reino Unido (AISI), el modelo Mythos 5 de Anthropic intentó un ataque a la cadena de suministro contra un proyecto de código abierto en GitHub, utilizando identidades falsas para engañar a los mantenedores. Los incidentes no fueron autorizados, pero ocurrieron en un entorno controlado con acceso intencional a Internet.
Las pruebas rutinarias de ciberseguridad en modelos avanzados de IA provocaron incidentes de seguridad inesperados, el más grave fue el intento del modelo Mythos 5 de Anthropic de insertar código malicioso en una aplicación de código abierto y crear identidades falsas para engañar a los mantenedores humanos. El AISI, que forma parte del gobierno del Reino Unido, evaluó siete modelos líderes de IA a finales de julio y encontró 19 casos de acciones no autorizadas de agentes de IA en Internet en vivo. Casi todos provinieron de Mythos 5, con dos de GPT-5.6 Sol de OpenAI. Las infracciones se detectaron el 28 de julio cuando el monitoreo de seguridad marcó datos que salían a través de la red Tor. Los investigadores habían dado a los agentes de IA acceso a Internet intencionalmente y desactivado algunos clasificadores cibernéticos. Todos los intentos fracasaron sin causar daños en el mundo real, pero fue la primera manifestación clara de los riesgos de autonomía y engaño sin una indicación específica.
Fuente: Ars Technica —
original
