AgentenAI-veiligheid 🇷🇺 12.08.2026 00:02

Hoe ik heb geverifieerd dat mijn vloot van AI-agenten echt autonoom is

AnthropicAnthropic
Een exploitant van een vloot AI-agenten vertelt hoe ze een verificatieomgeving hebben gebouwd om de autonomie van hun agenten te bewijzen. Ze definieerden vier invarianten als pure functies over gebeurtenislogboeken en voerden deze uit op echte gegevens. De resultaten toonden aan dat hoewel risico's van niveau 2 correct werden afgedekt door menselijke goedkeuring, onafhankelijke verificatie bijna nooit werd uitgevoerd, wat een kloof aan het licht bracht tussen de verklaarde discipline en de realiteit.
Een operator van een AI-agentenvloot, geen ontwikkelaar van oorsprong, wilde bewijzen dat hun vloot van vier machines die zes weken lang onderhandelingen voerden, werkelijk autonoom was. Ze definieerden vier invarianten (INV-1 tot en met INV-4) als pure functies op gebeurtenislogboeken om gedragsregels te verifiëren, zoals menselijke goedkeuring vóór het vastleggen van acties op niveau twee en onafhankelijke verificatie vóór vastleggingen. Door deze controles uit te voeren op 64 echte voorstellen en 317 gebeurtenissen, ontdekten ze dat INV-1 (menselijke poort voor niveau twee) voor 100% slaagde, maar INV-2 (onafhankelijke verificatie) slechts voor 7,7%, wat aangeeft dat VERIFICATIE adviserend was en niet werd afgedwongen. INV-3 betrapte een bug met duplicaatgebeurtenissen waarbij een hub ACCEPT 17 keer herhaalde, en INV-4 bracht vijf escalaties aan het licht die werden vastgelegd zonder te wachten op menselijke oplossing. De operator publiceerde deze resultaten transparant, inclusief een echt spoor dat zowel een correcte menselijke goedkeuringsstroom als hetzelfde spoor dat faalde voor INV-2 laat zien, omdat verificatie door de vastlegger werd uitgevoerd. Ze bespraken ook beperkingen, fouten en de open-sourcecode voor de evaluatieomgeving.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws