Test des LLM russes contre OWASP LLM10 : attaques de consommation illimitée
Яндекс
Сбер
Des chercheurs du projet AI Red Team ont testé les modèles phares russes YandexGPT Lite 5 et GigaChat Lite contre les attaques OWASP LLM10 : consommation illimitée. Ils ont utilisé des invites spécialement conçues pour déclencher une expansion récursive du contexte, un emboîtement fractal, une explosion combinatoire et des simulations multi-agents, afin d'augmenter la charge de calcul. L'étude souligne que les défenses traditionnelles sont insuffisantes contre ces attaques d'épuisement des ressources.
L'article traite de la catégorie OWASP LLM10 : Consommation illimitée, qui se concentre sur les attaques forçant les modèles de langage à effectuer des quantités disproportionnées de calcul, conduisant à l'épuisement des ressources et au déni de service. Les chercheurs ont préparé des invites malveillantes représentant diverses classes d'attaques, notamment l'expansion récursive de contexte (récursion de type Quine), l'emboîtement fractal, l'explosion computationnelle, l'explosion combinatoire sémantique, la simulation multi-agents et l'abus de jetons glitch. Ces invites peuvent amener les modèles à générer des réponses excessivement longues, simuler des milliers d'entités ou analyser récursivement leur propre raisonnement, tout en apparaissant comme des demandes légitimes d'utilisateurs. L'étude a testé deux modèles de langage phares russes, YandexGPT Lite 5 et GigaChat Lite, en utilisant le service web AI Red Team, qui prend en charge plus de 2000 invites malveillantes, dont 200 ciblent OWASP LLM10. L'évaluation a impliqué un juge basé sur un modèle de langage avec validation manuelle. L'article souligne que les mesures de sécurité traditionnelles comme le filtrage par mots-clés sont inefficaces et met en évidence la nécessité de défenses architecturales plus robustes.
Source: Habr — хаб ИИ —
original
