Cómo verifiqué que mi flota de agentes de IA es realmente autónoma
Anthropic
Un operador de una flota de agentes de IA describe cómo construyó un sistema de verificación para demostrar la autonomía de sus agentes. Definieron cuatro invariantes como funciones puras sobre registros de eventos y los ejecutaron con datos reales. Los resultados mostraron que, aunque los riesgos de nivel 2 estaban correctamente controlados por aprobación humana, la verificación independiente casi nunca se realizaba, revelando una brecha entre la disciplina declarada y la realidad.
Un operador de flotas de agentes de IA, sin formación previa como desarrollador, se propuso demostrar que su flota de cuatro máquinas, que negociaron durante seis semanas, era realmente autónoma. Definió cuatro invariantes (INV-1 a INV-4) como funciones puras sobre registros de eventos para verificar reglas de comportamiento, como la aprobación humana antes de comprometer acciones de nivel 2 y la verificación independiente antes de los commits. Al ejecutar estas comprobaciones sobre 64 propuestas reales y 317 eventos, descubrió que INV-1 (puerta humana para nivel 2) pasaba al 100%, pero INV-2 (verificación independiente) solo al 7,7%, lo que indica que VERIFY era consultivo y no se aplicaba. INV-3 detectó un error de ráfaga de eventos duplicados donde un hub repitió ACCEPT 17 veces, e INV-4 reveló cinco escalaciones que se comprometieron sin esperar la resolución humana. El operador publicó estos resultados de forma transparente, incluyendo un rastro real que muestra tanto un flujo de aprobación humana adecuado como el mismo rastro que falla INV-2 porque la verificación la realizó el propio committer. También discutieron limitaciones, errores y el código abierto del entorno de evaluación.
Fuente: Habr — хаб ИИ —
original
