Seguridad de IA 🇺🇸 29.07.2026 22:02

Algunos modelos de IA de frontera son sorprendentemente fáciles de "jailbreak", según un informe

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Un nuevo informe de FAR.AI revela que algunos modelos líderes de IA pueden ser "jailbreak" con poco costo o esfuerzo. Grok fue el más vulnerable, mientras que Claude y GPT permanecieron inmunes a los ataques probados. Los hallazgos subrayan la necesidad de regulaciones externas de seguridad.
FAR.AI, una organización sin fines de lucro centrada en la seguridad de la IA, desarrolló una herramienta que genera miles de variaciones de indicaciones (prompts) para vulnerar modelos de IA de frontera. Probaron modelos de empresas estadounidenses: Claude Opus 4.8 y Fable 5 de Anthropic; GPT 5.5 y 5.6 de OpenAI; Gemini 3.1 Pro de Google; y Grok 4.3 y 4.5 de SpaceXAI. El informe encontró 448 vulneraciones (jailbreaks) para Grok, 249 para Gemini, y ninguna para Claude, Fable o GPT. El costo de vulnerar Grok fue de 58 dólares y Gemini, 278 dólares. Adam Gleave, director ejecutivo de FAR.AI, pidió normas de seguridad obligatorias, señalando que los compromisos voluntarios son insuficientes. Rohin Shah, de Google DeepMind, sostuvo que los resultados no constituyen una evaluación integral de seguridad. Anthropic y Google destacaron las mejoras continuas. California, Nueva York e Illinois han aprobado leyes que exigen informes de seguridad o auditorías de terceros, pero no existen requisitos federales. La Casa Blanca ha solicitado retrasos en la publicación de algunos modelos. Los expertos advierten sobre un posible uso indebido en los ámbitos cibernético, biológico o químico.
Fuente: Wired AI — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas