Expuesta una falla de arquitectura en GPT-5, Claude y Gemini
OpenAI
Anthropic
Google/DeepMind
Un equipo internacional de investigadores ha descubierto una falla de arquitectura en los bloques cifrados de razonamiento en cadena de pensamiento de modelos líderes de inteligencia artificial como GPT-5, Claude y Gemini. Al emplear modelos hermanos más pequeños de los mismos proveedores, los atacantes pueden descifrar y leer todos los procesos de razonamiento, lo que podría exponer datos sensibles.
Un equipo internacional de investigadores ha descubierto una vulnerabilidad arquitectónica crítica en los bloques de razonamiento cifrados de los principales sistemas de inteligencia artificial, como GPT-5, Claude y Gemini. Estos sistemas generan internamente una cadena de pensamiento antes de responder, que los proveedores cifran y envían al cliente, solo para que se devuelva con las consultas de seguimiento. Los investigadores encontraron que OpenAI, Anthropic y Google utilizan claves de cifrado globales para sus familias de modelos, lo que significa que los bloques de razonamiento cifrados no están vinculados a un usuario, sesión o modelo específico. Esto permite a los atacantes tomar el bloque de razonamiento cifrado de un modelo insignia y enviarlo a un modelo hermano más pequeño y menos restringido, que luego lo descifra y genera el proceso de razonamiento completo. El equipo analizó repositorios públicos y registros, encontrando 315,320 bloques de razonamiento cifrados, y logró descifrar identificadores personales, claves de API, contraseñas y direcciones de correo electrónico. La vulnerabilidad también permite inyecciones de instrucciones ocultas y la clonación no autorizada de las capacidades del modelo. Los investigadores informaron de sus hallazgos a las empresas afectadas, que han comenzado a implementar contramedidas; sin embargo, hasta que el cifrado esté estrictamente vinculado a una sesión específica, los usuarios no pueden asumir que están protegidos.
Fuente: Heise online —
original
