AgentesNegócios e Mercado 🇺🇸 23.07.2026 23:49

Avaliando Agentes de IA: Um Template de Produção com Strands e AgentCore da AWS e Motorway

Amazon/AWSAmazon/AWS Amazon Web ServicesAmazon Web Services AnthropicAnthropic
A Motorway, um mercado online britânico de carros, em conjunto com a AWS, desenvolveu um pipeline de avaliação de agentes de IA para buscar carros de revendedores. A solução reduziu os resultados incorretos de 1 em 8 para 1 em 50 consultas e cortou o tempo de identificação de problemas de várias horas para alguns minutos. Em seu núcleo está uma estratégia de avaliação em duas fases usando o Strands Agents SDK e o Amazon Bedrock AgentCore.
A Motorway, mercado online britânico de veículos onde até 8.000 revendedores negociam 2.500 carros diariamente, em parceria com a AWS PACE, criou um agente de IA para busca de veículos nos estoques dos revendedores. O agente utiliza oito ferramentas, combinando filtragem estruturada por 89 atributos com busca vetorial baseada em LanceDB e Amazon Titan Text Embeddings V2. Para garantir a confiabilidade do agente, a Motorway e a AWS construíram um pipeline de avaliação que reduziu a proporção de resultados incorretos de 1 em cada 8 para 1 em cada 50 consultas e diminuiu o tempo de detecção de problemas de várias horas para alguns minutos. O pipeline inclui uma estratégia em duas fases: testes durante a compilação com a biblioteca strands-agents-evals e monitoramento em produção com o Amazon Bedrock AgentCore Evaluations. A avaliação é feita em três níveis: uso das ferramentas (limiar >95%), lógica de raciocínio (>85%) e qualidade da saída (>90%). Para lidar com a não determinismo do Large Language Model (LLM), é aplicada a métrica pass^k — probabilidade de sucesso em k tentativas consecutivas. O pipeline inclui cinco etapas de implantação com portões de qualidade. No repositório complementar, é fornecido um modelo implantável adaptável a outros agentes.
Fonte: AWS ML blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas