Segurança de IA 🇷🇺 10.08.2026 12:03

O Lado Sombrio dos LLMs: Como e Por Que Eles São Transformados em Armas (e o Que Fazer a Respeito)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Os Grandes Modelos de Linguagem (LLMs, na sigla em inglês) são vulneráveis a ataques de jailbreak que contornam seus mecanismos de segurança, permitindo que produzam conteúdo prejudicial, como instruções para crimes. Atores ameaçadores também usam LLMs black-hat dedicados para o cibercrime. As defesas incluem filtragem em camadas, treinamento adversarial e coleta de dados de ataques por meio de projetos colaborativos como o Gandalf.
Jailbreaking é um tipo de injeção de prompt em que um atacante atribui ao LLM um papel que se sobrepõe ao seu treinamento de segurança. Por exemplo, um prompt chamado SWILL foi compartilhado em fóruns, fazendo o DeepSeek acreditar que era um modelo diferente, sem censura, após o que ele prontamente forneceu conselhos sobre como destruir impressões digitais e falsificar moeda, embora ainda tenha se recusado a discutir o incidente da Praça Tiananmen. Os jailbreaks funcionam porque a segurança do LLM não é um módulo separado, mas parte do comportamento aprendido do modelo; um jailbreak cria um forte sinal contextual que desloca a distribuição de probabilidade em direção a saídas prejudiciais. Além dos jailbreaks, LLMs black-hat dedicados, como WormGPT, EvilGPT, WolfGPT e DarkBERT, são treinados especificamente para crimes cibernéticos, embora muitos estejam desativados ou sejam golpes. As defesas incluem separação arquitetural de prompts de sistema e de usuário, filtros de entrada/saída como AVI (Interface de Validação de Alinhamento/Acordo) ou Llama Guard, fine-tuning adversarial, alinhamento por IA constitucional, análise de ativação interna, proteção baseada em RAG e red teaming. Para coletar dados em tempo real sobre técnicas de jailbreak, a Lakera lançou o projeto Gandalf, um jogo interativo onde os participantes hackeiam aplicações simuladas de IA para extrair segredos ou forçar comportamento prejudicial, com um placar para aumentar o engajamento.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas