Seguridad de IA 🇷🇺 11.08.2026 21:02

Los pensamientos de la IA pueden leerse usando otra IA, revelando contraseñas y claves en su interior

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Investigadores han demostrado un ataque que descifra las trazas de razonamiento ocultas de los modelos de lenguaje grandes (LLM) propietarios de Anthropic, OpenAI y Google mediante dos llamadas a la API, sin atacar al modelo objetivo. El método también reveló que los registros públicos de agentes contienen cientos de secretos, incluidas contraseñas y claves, ocultos dentro de bloques cifrados.
Ocho investigadores del ELLIS Institute Tübingen, el Instituto Max Planck de Sistemas Inteligentes, el Centro de IA de Tübingen, MATS y Snyk publicaron un preprint el 10 de agosto que describe un ataque contra los rastros de razonamiento cifrados de modelos de Anthropic, OpenAI y Google. El ataque consiste en tomar el bloque cifrado de un modelo potente (por ejemplo, Claude Opus 4.8) y alimentarlo a un modelo más débil del mismo proveedor (por ejemplo, Haiku 4.5), al que luego se le pide que reescriba el razonamiento palabra por palabra, descifrándolo así. El ataque no rompe el cifrado ni ataca al modelo potente; explota el hecho de que el bloque cifrado se devuelve al cliente y debe reenviarse con la siguiente solicitud. Los investigadores verificaron la autenticidad de los rastros descifrados en 120 tareas de Codeforces. También escanearon 6708 registros públicos de agentes de GitHub y Hugging Face, recuperando 315 320 bloques de razonamiento, que contenían 704 secretos únicos, incluidos 62 claves de API, 33 contraseñas, 24 tokens de acceso, además de correos electrónicos, nombres y URL internas. Notablemente, 64 de estos secretos no eran visibles en ningún lugar de la sesión visible, existiendo solo dentro de los bloques cifrados. El documento también describe un vector de envenenamiento donde un bloque malicioso puede ser plantado para inyectar instrucciones en un agente que luego lo carga. Los autores proponen medidas criptográficas y de sistema para vincular el bloque a la sesión, al usuario y al modelo, pero por ahora, los usuarios deben tratar los bloques de razonamiento cifrados como secretos y evitar compartir registros públicamente.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas