Como Verifiquei que Minha Frota de Agentes de IA É Realmente Autônoma
Anthropic
Um operador de uma frota de agentes de IA descreve como construiu um harness de verificação para provar a autonomia de seus agentes. Eles definiram quatro invariantes como funções puras sobre logs de eventos e as executaram em dados reais. Os resultados mostraram que, embora os riscos de nível 2 fossem adequadamente controlados pela aprovação humana, a verificação independente quase nunca era realizada, revelando uma lacuna entre a disciplina declarada e a realidade.
Um operador de frota de agentes de IA, sem formação em desenvolvimento, decidiu provar que sua frota de quatro máquinas, que conduziu negociações ao longo de seis semanas, era verdadeiramente autônoma. Eles definiram quatro invariantes (INV-1 a INV-4) como funções puras sobre logs de eventos para verificar regras comportamentais, como aprovação humana antes de comprometer ações de nível 2 e verificação independente antes de commits. Executando essas verificações sobre 64 propostas reais e 317 eventos, descobriram que INV-1 (controle humano para nível 2) passou em 100% dos casos, mas INV-2 (verificação independente) apenas em 7,7%, indicando que VERIFY era consultivo e não obrigatório. O INV-3 detectou um bug de duplicação de eventos em que um hub repetiu ACCEPT 17 vezes, e o INV-4 revelou cinco escalonamentos que foram comprometidos sem aguardar resolução humana. O operador publicou esses resultados de forma transparente, incluindo um rastro real mostrando tanto um fluxo adequado de aprovação humana quanto o mesmo rastro falhando no INV-2, porque a verificação foi feita pelo committer. Eles também discutiram limitações, erros e o código aberto do harness de avaliação.
Fonte: Habr — хаб ИИ —
original
