AI-veiligheid RSS

AI-veiligheid 🇺🇸

Google DeepMind onthult Gemini 3.5 Flash Cyber — een lichtgewicht model voor cybersecurity

Google DeepMind heeft Gemini 3.5 Flash Cyber aangekondigd, een gespecialiseerd model gebaseerd op 3.5 Flash, verfijnd voor het zoeken naar, verifiëren en verhelpen van kwetsbaarheden. Het model zal beschikbaar zijn via een beperkt proefprogramma voor overheden en vertrouwde partners voor proactieve mitigatie van kritieke kwetsbaarheden.

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind24.07 · 11:04
AI-veiligheid 🇷🇺

Prompt-injectie kan niet worden genezen door filters: hoe u onvertrouwde tekst isoleert met architectuurpatronen

Prompt-injectie is een structureel defect in grote taalmodellen waarbij onvertrouwde tekst als instructie wordt uitgevoerd. Filters en systeemprompts zijn niet effectief: zelfs de beste verdedigingen worden in 90% van de gevallen doorbroken bij adaptieve aanvallen. Werkende benaderingen—Dual-LLM, CaMeL en de Twee Meta-regel—bouwen isolatie op in plaats van te proberen goed van kwaad te onderscheiden.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Vers nieuws