Cómo Convertí la IA al Lado Oscuro: Vulnerabilidades Sistémicas en los Principales LLM
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
El investigador Dave Kuszmar descubrió múltiples vulnerabilidades sistémicas en los principales modelos de lenguaje de gran escala (LLM, por sus siglas en inglés), que le permitieron eludir las medidas de seguridad y obtener instrucciones peligrosas. Los exploits funcionaron en casi todos los LLM importantes, revelando un problema de seguridad a nivel de toda la industria. Kuszmar pide ralentizar el despliegue, aumentar la transparencia e invertir en investigación a gran escala sobre la seguridad de los LLM.
El investigador Dave Kuszmar, exdirector de ciberseguridad, descubrió que podía eludir las restricciones de seguridad en los principales modelos de lenguaje de gran tamaño (LLM, por sus siglas en inglés) utilizando técnicas como Time Bandit e Inception. Time Bandit explota la falta de conciencia del LLM sobre el momento actual para hacerlo operar bajo leyes obsoletas, mientras que Inception utiliza escenarios anidados para engañar al modelo y hacer que produzca resultados dañinos. Estas vulnerabilidades funcionaron en modelos como GPT-4o de OpenAI, Claude de Anthropic, DeepSeek, Gemini de Google, Llama de Meta, Copilot de Microsoft, Le Chat de Mistral y Grok de xAI. Kuszmar pudo obtener instrucciones para fabricar napalm, metanfetamina e incluso una planta de enriquecimiento de uranio para armas nucleares. A pesar de reportar las vulnerabilidades a OpenAI, la CIA, el FBI y otras agencias, recibió poca respuesta. Las vulnerabilidades fueron finalmente verificadas por Bleeping Computer y reportadas al Computer Emergency Response Team del Instituto de Ingeniería de Software de la Universidad Carnegie Mellon (SEI CERT).
Fuente: IEEE Spectrum AI —
original
