O Lado Sombrio dos LLMs: Como e Por Que Eles São Transformados em Armas (e o Que Fazer a Respeito)
Os Grandes Modelos de Linguagem (LLMs, na sigla em inglês) são vulneráveis a ataques de jailbreak que contornam seus mecanismos de segurança, permitindo que produzam conteúdo prejudicial, como instruções para crimes. Atores ameaçadores também usam LLMs black-hat dedicados para o cibercrime. As defesas incluem filtragem em camadas, treinamento adversarial e coleta de dados de ataques por meio de projetos colaborativos como o Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
