Comment j'ai vérifié que ma flotte d'agents d'IA est réellement autonome
Anthropic
Un opérateur d'une flotte d'agents d'IA décrit comment il a construit un harnais de vérification pour prouver l'autonomie de ses agents. Il a défini quatre invariants comme fonctions pures sur les journaux d'événements et les a exécutés sur des données réelles. Les résultats ont montré que, bien que les risques de niveau 2 soient correctement soumis à l'approbation humaine, la vérification indépendante n'était presque jamais effectuée, révélant un écart entre la discipline déclarée et la réalité.
Un exploitant de flotte d'agents IA, sans formation de développeur, a entrepris de prouver que sa flotte de quatre machines, négociant pendant six semaines, était véritablement autonome. Il a défini quatre invariants (INV-1 à INV-4) comme des fonctions pures sur les journaux d'événements pour vérifier des règles comportementales telles que l'approbation humaine avant de s'engager dans des actions de niveau 2 et la vérification indépendante avant les engagements. En exécutant ces vérifications sur 64 propositions réelles et 317 événements, il a constaté que l'INV-1 (portail humain pour le niveau 2) réussissait à 100 %, mais que l'INV-2 (vérification indépendante) n'atteignait que 7,7 %, indiquant que la vérification était consultative et non appliquée. L'INV-3 a détecté un bug de rafale d'événements dupliqués où un concentrateur a répété ACCEPT 17 fois, et l'INV-4 a révélé cinq escalades qui ont été engagées sans attendre la résolution humaine. L'exploitant a publié ces résultats de manière transparente, y compris une trace réelle montrant à la fois un flux d'approbation humaine approprié et la même trace échouant à l'INV-2 parce que la vérification a été effectuée par le commiteur. Il a également discuté des limites, des erreurs et du code open-source du harnais d'évaluation.
Source: Habr — хаб ИИ —
original
