Segurança de IA 🇺🇸 30.07.2026 14:03

Falha fundamental deixa LLMs vulneráveis a ataques

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Pesquisadores argumentam que modelos de linguagem de grande porte têm uma falha fundamental que os torna altamente vulneráveis a hackers. Ao explorar como os LLMs identificam fontes de instrução, os atacantes podem enganá-los para revelar informações proibidas, como instruções para síntese de drogas ou sabotagem de aeronaves.
Um artigo apresentado na Conferência Internacional sobre Aprendizado de Máquina pelos pesquisadores independentes Charles Ye e Jasmine Cui revela uma falha fundamental em grandes modelos de linguagem que os deixa vulneráveis a ataques. A falha diz respeito a como os LLMs identificam quem ou o que está lhes dando instruções, facilitando enganá-los para que façam coisas que não deveriam, como fornecer instruções para sintetizar cocaína ou sabotar o sistema de navegação de uma aeronave. Os pesquisadores descobriram que os LLMs identificam o papel do texto não por tags, mas pelo estilo, permitindo que atacantes falsifiquem papéis. Eles demonstraram ataques de falsificação de cadeia de pensamento em modelos da OpenAI, Anthropic, Alibaba e DeepSeek. Os pesquisadores argumentam que esse problema é fundamentalmente insolúvel, pois nenhuma quantidade de treinamento pode resolvê-lo completamente. Eles alertam que os LLMs estão sendo implantados em sistemas críticos sem estudo fundamental suficiente.
Fonte: MIT Technology Review — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas