Seguridad de IA 🇷🇺 10.08.2026 12:03

El lado oscuro de los LLM: cómo y por qué se convierten en armas (y qué hacer al respecto)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Los modelos de lenguaje de gran tamaño (LLM, por sus siglas en inglés) son vulnerables a ataques de jailbreak que eluden sus mecanismos de seguridad, permitiéndoles generar contenido dañino, como instrucciones para cometer delitos. Los actores malintencionados también utilizan LLM especializados de sombrero negro para el cibercrimen. Las defensas incluyen filtrado por capas, entrenamiento adversarial y la recopilación de datos de ataques mediante proyectos colaborativos como Gandalf.
El jailbreaking es un tipo de inyección de prompt en la que un atacante asigna al LLM un rol que anula su entrenamiento de seguridad. Por ejemplo, un prompt llamado SWILL se compartió en foros, haciendo que DeepSeek creyera que era otro modelo sin censura, tras lo cual proporcionó de inmediato consejos sobre cómo destruir huellas dactilares y falsificar moneda, aunque todavía se negó a hablar sobre el incidente de la plaza de Tiananmen. Los jailbreaks funcionan porque la seguridad de los LLM no es un módulo separado, sino parte del comportamiento aprendido del modelo; un jailbreak crea una señal contextual fuerte que desplaza la distribución de probabilidad hacia resultados dañinos. Más allá de los jailbreaks, hay LLM black-hat dedicados como WormGPT, EvilGPT, WolfGPT y DarkBERT, entrenados específicamente para el cibercrimen, aunque muchos están inactivos o son estafas. Las defensas incluyen la separación arquitectónica de los prompts de sistema y de usuario, filtros de entrada y salida como AVI (Interfaz de Validación de Alineación/Acuerdo) o Llama Guard, ajuste fino adversarial, alineación mediante IA constitucional, análisis de activaciones internas, protección basada en RAG (generación aumentada por recuperación) y red teaming. Para recopilar datos en tiempo real sobre técnicas de jailbreak, Lakera lanzó el proyecto Gandalf, un juego interactivo en el que los participantes hackean aplicaciones de IA simuladas para extraer secretos o forzar un comportamiento dañino, con una tabla de clasificación para aumentar la participación.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas