Amazon Bedrock AgentCore: Detectando Falhas Ocultas de Agentes de IA
Amazon/AWS
A Amazon Bedrock lançou a otimização do AgentCore, que identifica falhas 'silenciosas' de agentes de IA — erros de comportamento que não são capturados por métricas padrão (99% de sucesso, zero erros). A ferramenta analisa rastros de sessão, agrupa falhas (11 tipos, incluindo alucinações, ações incorretas) e indica a causa raiz, oferecendo correções priorizadas. Além das falhas, o AgentCore mostra a distribuição das intenções do usuário e as estratégias reais do agente.
A Amazon Bedrock lançou a otimização AgentCore, projetada para detectar falhas comportamentais de agentes de IA que não são visíveis pelo monitoramento padrão: o sistema mostra 99% de sucesso, latência zero e nenhum erro, mas os clientes reclamam de resultados incorretos (por exemplo, alteração de pedido não executada ou etapa de aprovação ignorada). O AgentCore analisa os traces das sessões coletados via CloudWatch e estrutura as falhas de acordo com uma taxonomia de 11 categorias (alucinações, ações incorretas, violação de instruções, erros de orquestração, etc.), identificando até aquelas que não geram sinais de erro. O sistema agrupa as falhas por centenas de sessões, determina a causa raiz (por exemplo, invenção de dados financeiros sem chamada de ferramentas) e classifica os clusters pela proporção de sessões afetadas, para que o desenvolvedor possa ver imediatamente qual problema impacta 30% do tráfego e qual afeta apenas três sessões. O AgentCore também agrupa as solicitações dos usuários (mostrando quanto tráfego corresponde a cenários-alvo, parcialmente suportados ou não previstos) e extrai resumos acionáveis de cada sessão, identificando discrepâncias entre o comportamento esperado e o real do agente. A configuração inclui a seleção dos tipos de análise (falhas, intenções, execução), a especificação da fonte de traces (agente do AgentCore ou diretamente CloudWatch) e a programação (única ou recorrente). Exemplo: um agente de tendências de mercado em 1 de cada 10 sessões alucinava dados financeiros sem usar ferramentas; a correção foi reforçar o prompt do sistema. Os insights deslocam o modelo de observabilidade de uma visualização reativa de traces para uma detecção proativa de padrões, permitindo corrigir primeiro os problemas mais críticos.
Fonte: AWS ML blog —
original
