Russische LLM's getest tegen OWASP LLM10: aanvallen met onbegrensde consumptie
Яндекс
Сбер
Onderzoekers van het AI Red Team-project hebben de Russische vlaggenschipmodellen YandexGPT Lite 5 en GigaChat Lite getest tegen OWASP LLM10-aanvallen met onbegrensde consumptie. Ze gebruikten speciaal vervaardigde prompts om recursieve contextuitbreiding, fractale nesting, combinatorische explosies en multi-agent simulaties te triggeren, met als doel de rekenlast te verhogen. De studie benadrukt dat traditionele verdedigingsmechanismen ontoereikend zijn tegen dergelijke uitputtingsaanvallen.
Het artikel bespreekt de OWASP LLM10-categorie 'Onbegrensde consumptie' (Unbounded Consumption), die zich richt op aanvallen die taalmodellen dwingen om onevenredig veel rekenwerk te verrichten, wat leidt tot uitputting van middelen en denial of service. De onderzoekers stelden kwaadaardige prompts op die verschillende aanvalsklassen vertegenwoordigen, waaronder recursieve contextuitbreiding (Quine-achtige recursie), fractale nesting, computationele explosie, semantische combinatorische explosie, multi-agent simulatie en misbruik van glitch-tokens. Deze prompts kunnen ertoe leiden dat modellen buitengewoon lange antwoorden genereren, duizenden entiteiten simuleren, of hun eigen redeneringen recursief analyseren, terwijl ze eruitzien als legitieme gebruikersverzoeken. De studie testte twee Russische vlaggenschip-LLM's, YandexGPT Lite 5 en GigaChat Lite, via de AI Red Team-webservice, die meer dan 2000 kwaadaardige prompts ondersteunt, waarvan 200 gericht zijn op OWASP LLM10. De evaluatie maakte gebruik van LLM-as-judge met handmatige validatie. Het artikel benadrukt dat traditionele beveiligingsmaatregelen zoals het filteren op trefwoorden niet effectief zijn, en wijst op de noodzaak van robuustere architecturale verdedigingen.
Bron: Habr — хаб ИИ —
origineel
