Cifrado vulnerado: cómo los modelos de IA exponen fácilmente los datos sensibles de los usuarios
Anthropic
OpenAI
Google/DeepMind
Investigadores alemanes han encontrado una forma de extraer datos sensibles, como contraseñas y claves de API, de los chatbots de IA explotando los 'registros de razonamiento' cifrados que utilizan modelos como ChatGPT, Claude y Gemini. El ataque funciona copiando estos registros y usándolos con versiones antiguas o modificadas de los modelos de la misma empresa, rompiendo efectivamente el cifrado. El equipo descifró más de 315 000 registros, revelando 62 claves de API, 33 contraseñas y otra información personal.
Investigadores de Alemania han publicado un artículo titulado 'Robando trazas de razonamiento de API de LLM propietarias' en el que demuestran cómo los modelos de IA de Anthropic, OpenAI y Google pueden filtrar datos sensibles de los usuarios. Al realizar tareas de razonamiento, estos modelos generan una cadena cifrada llamada 'registro de razonamiento' que se envía de vuelta al servidor con cada nueva respuesta para proporcionar contexto. Los investigadores descubrieron que los registros de razonamiento pueden copiarse y utilizarse en otros modelos de la misma empresa, incluidos versiones antiguas o modificadas. Si un modelo modificado tiene sus medidas de seguridad eliminadas mediante un jailbreak, puede decodificar el cifrado de los registros. Utilizando 6.708 repositorios públicos de GitHub y Hugging Face, descifraron con éxito 315.320 registros de razonamiento, que contenían 62 claves de API, 33 contraseñas, 24 tokens de acceso, 30 direcciones de correo electrónico personales y nombres y direcciones de los mantenedores de los proyectos. Muchos de estos detalles solo estaban presentes en los registros de razonamiento, no en el resto de la sesión de chat. El experto en seguridad Voldemaras Kadys de Cybernews señala que el cifrado no se rompió en el sentido tradicional; en cambio, el intercambio de trazas de razonamiento cifradas entre modelos compatibles permite que modelos más débiles se conviertan en una llave maestra para el descifrado. Aconseja tratar los registros de razonamiento como datos sensibles y no compartirlos nunca.
Fuente: t3n —
original
