Modelos de IA propensos a 'pensar demasiado' crea una vulnerabilidad de seguridad
DeepSeek
Alibaba/Qwen
OpenAI
Google/DeepMind
Investigadores de la Universidad de Zhejiang y Alibaba han demostrado un método para inducir deliberadamente el 'pensamiento excesivo' en modelos de IA de razonamiento al someterlos a instrucciones lógicamente inconsistentes. Este ataque de instrucción evolutiva puede generar resultados hasta 26 veces más largos, actuando efectivamente como un ataque de denegación de servicio en servicios comerciales de IA.
Los modelos de lenguaje grandes (LLM, por sus siglas en inglés) que utilizan razonamiento paso a paso son vulnerables a un fenómeno llamado 'sobrepensamiento', en el que producen cadenas de razonamiento excesivamente largas. Investigadores de la Universidad de Zhejiang y Alibaba desarrollaron un algoritmo evolutivo que corrompe la estructura lógica de las indicaciones, haciendo que los modelos entren en bucles de razonamiento infructuosos. El ataque fue efectivo contra modelos de DeepSeek (R1), Alibaba (Qwen3-Thinking), OpenAI (GPT-o3) y Google (Gemini 2.5 Flash), generando salidas hasta 26,1 veces más largas en un punto de referencia matemático. El enfoque no requiere acceso interno a los modelos y puede transferirse entre ellos, lo que aumenta su viabilidad. Sin embargo, los investigadores enfatizan que su objetivo es destacar la vulnerabilidad, no desarrollar un ataque práctico, y esperan que los proveedores implementen mitigaciones.
Fuente: IEEE Spectrum AI —
original
