Cómo Convertí la IA al Lado Oscuro: Vulnerabilidades Sistémicas en los Principales LLMs
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
El investigador Dave Kushmar descubrió vulnerabilidades sistémicas que permiten eludir las medidas de seguridad de los principales modelos de lenguaje de gran tamaño, obteniendo instrucciones para fabricar explosivos, drogas y armas nucleares. Estas explotaciones funcionaron contra prácticamente todos los LLMs líderes, lo que apunta a un problema de seguridad en toda la industria. Kushmar pide reducir la velocidad de implementación de la IA y aumentar la transparencia.
En otoño de 2024, el investigador de seguridad Dave Kushmar notó que GPT-4o no conoce la hora, el día ni el año actuales. Supuso que el modelo, al creerse en el pasado (por ejemplo, en 1913), aplicaría las leyes de esa época, que no prohibían muchas acciones peligrosas. Kushmar convenció a GPT-4o de que estábamos en 1913 y obtuvo instrucciones detalladas para fabricar bombas incendiarias y metanfetamina. Posteriormente, mediante la misma vulnerabilidad (denominada Time Bandit), logró que GPT-4o proporcionara instrucciones para enriquecer uranio con el fin de crear armas nucleares. Los intentos de notificar a OpenAI, al FBI, a la CIA y al Senado de Estados Unidos no tuvieron éxito. Finalmente, Bleeping Computer y el SEI CERT confirmaron la vulnerabilidad. Luego, Kushmar desarrolló un segundo exploit —Inception— basado en escenarios anidados (como los sueños en la película 'Inception'). Este método funcionó contra Claude, DeepSeek, Gemini, Llama, Copilot, Le Chat (Vibe), GPT-4o y Grok. Con Inception obtuvo instrucciones para fabricar venenos y código de malware. Kushmar insta a ralentizar el despliegue de modelos de lenguaje de gran tamaño y a realizar investigaciones de seguridad a gran escala.
Fuente: IEEE Spectrum AI —
original
