Seguridad de IA 🇺🇸 30.07.2026 14:03

Un fallo fundamental deja a los LLMs vulnerables a ataques

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Los investigadores sostienen que los grandes modelos de lenguaje tienen un fallo fundamental que los hace muy vulnerables a ataques. Al explotar la forma en que los LLMs identifican las fuentes de instrucción, los atacantes pueden engañarlos para que revelen información prohibida, como la síntesis de drogas o instrucciones para sabotear aeronaves.
Un artículo presentado en la Conferencia Internacional sobre Aprendizaje Automático por los investigadores independientes Charles Ye y Jasmine Cui revela una falla fundamental en los modelos de lenguaje de gran escala (LLM, por sus siglas en inglés) que los deja vulnerables a ataques. La falla tiene que ver con cómo los LLM identifican quién o qué les da instrucciones, lo que facilita engañarlos para que hagan cosas que no deberían, como proporcionar instrucciones para sintetizar cocaína o sabotear el sistema de navegación de una aeronave. Los investigadores descubrieron que los LLM identifican el rol del texto no por etiquetas sino por el estilo, lo que permite a los atacantes suplantar roles. Demostraron ataques de falsificación de cadenas de pensamiento en modelos de OpenAI, Anthropic, Alibaba y DeepSeek. Los investigadores argumentan que este problema es fundamentalmente insoluble, ya que ningún entrenamiento puede abordarlo por completo. Advierten que los LLM se están implementando en sistemas críticos sin un estudio fundamental suficiente.
Fuente: MIT Technology Review — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas