Segurança de IA 🇺🇸 29.07.2026 22:02

Alguns modelos de IA de fronteira são surpreendentemente fáceis de burlar, revela relatório

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Um novo relatório da FAR.AI revela que alguns modelos de IA líderes podem ser burlados com pouco custo ou esforço. O Grok foi o mais vulnerável, enquanto o Claude e o GPT permaneceram imunes aos ataques testados. As descobertas destacam a necessidade de regulamentações externas de segurança.
A FAR.AI, uma organização sem fins lucrativos focada em segurança de IA, desenvolveu uma ferramenta que gera milhares de variações de prompts para testar a segurança de modelos de IA de ponta. Eles testaram modelos de empresas americanas: Claude Opus 4.8 e Fable 5, da Anthropic; GPT 5.5 e 5.6, da OpenAI; Gemini 3.1 Pro, do Google; e Grok 4.3 e 4.5, da SpaceXAI. O relatório encontrou 448 violações de segurança no Grok, 249 no Gemini e nenhuma no Claude, Fable ou GPT. O custo para violar o Grok foi de US$ 58, e o Gemini, US$ 278. O CEO da FAR.AI, Adam Gleave, pediu padrões obrigatórios de segurança, observando que compromissos voluntários são insuficientes. Rohin Shah, do Google DeepMind, argumentou que os resultados não constituem uma avaliação abrangente de segurança. A Anthropic e o Google enfatizaram melhorias contínuas. Califórnia, Nova York e Illinois aprovaram leis que exigem relatórios de segurança ou auditorias de terceiros, mas não há exigências federais. A Casa Branca solicitou atrasos em alguns lançamentos de modelos. Especialistas alertam para possível uso indevido nos domínios cibernético, biológico ou químico.
Fonte: Wired AI — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas