AgentenBedrijf & Markt 🇺🇸 23.07.2026 23:49

AI-agenten evalueren: Een productieblauwdruk met Strands en AgentCore van AWS en Motorway

Amazon/AWSAmazon/AWS Amazon Web ServicesAmazon Web Services AnthropicAnthropic
Motorway, een Britse online automarktplaats, werkte samen met AWS om een AI-gestuurde zoekagent voor dealerinventaris te bouwen. Ze ontwikkelden een evaluatiepijplijn die de Strands Agents SDK en Amazon Bedrock AgentCore combineert, waardoor foutieve resultaten daalden van 1 op de 8 queries naar 1 op de 50 en de tijd om problemen te detecteren werd teruggebracht van uren naar minuten. De blauwdruk omvat een drielaags evaluatiekader voor toolgebruik, redenering en outputkwaliteit, met kwaliteitspoorten die implementaties blokkeren wanneer metrieken onder drempelwaarden zakken.
Motorway organiseert een dagelijkse veiling waar tot 8.000 dealers bieden op maximaal 2.500 voertuigen. In samenwerking met AWS bouwden ze een AI-agent waarmee dealers de voorraad kunnen doorzoeken met behulp van natuurlijke taal in plaats van handmatig te filteren. De agent stelt acht tools beschikbaar die gestructureerd filteren op 89 voertuigkenmerken combineren met vector-gelijkeniszoekopdracht via LanceDB en Amazon Titan Text Embeddings V2. Om betrouwbaarheid te garanderen, creëerden ze een tweetraps evaluatiestrategie: testen tijdens de bouwfase met strands-agents-evals en productiemonitoring met Amazon Bedrock AgentCore Evaluations. Een drielaags kader beoordeelt toolgebruik (drempelwaarde van meer dan 95%), redenering (meer dan 85%) en uitvoerkwaliteit (meer dan 90%). Een pass^k-metriek gaat om met niet-determinisme: voor klantgerichte agents telt opeenvolgend succes in pogingen het meest. De pijplijn verminderde onjuiste resultaten van 1 op 8 queries naar 1 op 50 en verkortte de detectietijd van problemen van uren naar minuten. Een bijbehorende repository biedt een inzetbaar blauwdruk dat aanpasbaar is voor andere agents.
Bron: AWS ML blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws