Seguridad de IA RSS

Seguridad de IA 🇺🇸

Google DeepMind presenta Gemini 3.5 Flash Cyber, un modelo ligero para ciberseguridad

Google DeepMind ha anunciado Gemini 3.5 Flash Cyber, un modelo especializado basado en 3.5 Flash, ajustado para la búsqueda, verificación y corrección de vulnerabilidades. El modelo estará disponible a través de un programa piloto limitado para gobiernos y socios de confianza para la mitigación proactiva de vulnerabilidades críticas.

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind24.07 · 11:04
Seguridad de IA 🇷🇺

La inyección de instrucciones no se cura con filtros: cómo aislar texto no confiable usando patrones arquitectónicos

La inyección de instrucciones es un defecto estructural en los modelos de lenguaje grandes donde el texto no confiable se ejecuta como una instrucción. Los filtros y las instrucciones del sistema son ineficaces: incluso las mejores defensas son vulneradas en el 90% de los casos bajo ataques adaptativos. Los enfoques que funcionan —Dual-LLM, CaMeL y la regla de los dos meta— construyen aislamiento en lugar de intentar distinguir el bien del mal.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Noticias frescas