AgentsSécurité de l'IA 🇷🇺 28.07.2026 10:02

416 tests et un bouton « tout détruire » : là où les projets d'agents échouent

AnthropicAnthropic
Une analyse de six projets d'agents révèle des défauts récurrents : la sécurité réduite à du texte, des actions irréversibles sans barrière, et zéro test comportemental. Même un projet open source mature avec des tests de régression manque encore de garde-fous pour l'envoi irréversible d'e-mails. L'auteur propose dix questions de diagnostic pour évaluer la maturité d'un système d'agents.
L'auteur fait tourner un agent autonome appelé Groundhog (Surok) depuis février 2026 sur une boucle de recherche avec Claude Code et --dangerously-skip-permissions. Il a ensuite audité six de ses propres projets d'agents à l'aide d'une liste de contrôle composite issue de six sources (dont la méthodologie PDLC d'AI-DISRUPT de Sber) et a découvert trois schémas d'échec récurrents : la sécurité n'est imposée que dans les prompts (le modèle peut être outrepassé), des actions irréversibles sans confirmation (par exemple, une commande de reconstruction efface toutes les données enrichies), et zéro test de régression pour les bugs comportementaux. L'auteur a également examiné un grand projet open source anonyme d'agents : il comportait des vérifications d'autorisation au niveau du code et des tests de régression pour les bugs passés, mais envoyait toujours des e-mails de manière irréversible sans étape de brouillon ni confirmation. Un nouveau framework open source (HarnessX) propose une porte interrupt_on, mais elle est optionnelle et non activée par défaut. La méthodologie PDLC de Sber formalise une grande partie des contrôles manquants : la politique comme code, les évaluations comme contrats d'achèvement, et une échelle de permissions R0–R5 avec abandon/retour arrière obligatoire pour les opérations modifiant l'état à partir de R3+. L'auteur a construit un septième projet en mettant en pratique certaines leçons apprises : désormais, les évaluations sont exécutées avant chaque publication et les incidents deviennent des tests de régression nommés.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches