El lado oscuro de los LLM: cómo y por qué se convierten en armas (y qué hacer al respecto)
Los modelos de lenguaje de gran tamaño (LLM, por sus siglas en inglés) son vulnerables a ataques de jailbreak que eluden sus mecanismos de seguridad, permitiéndoles generar contenido dañino, como instrucciones para cometer delitos. Los actores malintencionados también utilizan LLM especializados de sombrero negro para el cibercrimen. Las defensas incluyen filtrado por capas, entrenamiento adversarial y la recopilación de datos de ataques mediante proyectos colaborativos como Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
