Tekoälyturvallisuus RSS

Google DeepMind esittelee Gemini 3.5 Flash Cyber -kevyen kyberturvallisuusmallin

Google DeepMind on julkistanut Gemini 3.5 Flash Cyber -mallin, joka on 3.5 Flash -pohjainen erikoistunut malli, hienosäädetty haavoittuvuuksien etsimiseen, vahvistamiseen ja korjaamiseen. Malli on saatavilla rajoitetun pilottiohjelman kautta hallituksille ja luotetuille kumppaneille kriittisten haavoittuvuuksien ennakoivaan lieventämiseen.

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind24.07 · 11:04

Prompt-injektiota ei voi parantaa suodattimilla: Kuinka eristää epäluotettava teksti arkkitehtuuristen mallien avulla

Prompt-injektio on suurten kielimallien rakenteellinen vika, jossa epäluotettava teksti suoritetaan käskynä. Suodattimet ja järjestelmäkehotukset eivät ole tehokkaita: jopa parhaat puolustukset murretaan 90 prosentissa tapauksista adaptiivisissa hyökkäyksissä. Toimivat lähestymistavat – Dual-LLM, CaMeL ja Two Meta -sääntö – rakentavat eristystä sen sijaan, että yritettäisiin erottaa hyvä pahasta.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Tuoreet uutiset