Evaluierung von KI-Agenten: Ein Produktions-Blueprint mit Strands und AgentCore von AWS und Motorway
Amazon/AWS
Amazon Web Services
Anthropic
Motorway, ein britischer Online-Automarktplatz, hat in Zusammenarbeit mit AWS einen KI-gestützten Händlerbestandssuchagenten entwickelt. Sie bauten eine Evaluierungspipeline, die Strands Agents SDK und Amazon Bedrock AgentCore kombiniert, wodurch fehlerhafte Ergebnisse von 1 von 8 Abfragen auf 1 von 50 reduziert und die Zeit zur Erkennung von Problemen von Stunden auf Minuten verkürzt wurde. Der Blueprint umfasst ein dreischichtiges Evaluierungsframework für Tool-Nutzung, Argumentation und Ausgabequalität, mit Qualitätsbarrieren, die Deployments blockieren, wenn Metriken unter Schwellenwerte fallen.
Motorway führt eine tägliche Auktion durch, bei der bis zu 8.000 Händler auf bis zu 2.500 Fahrzeuge bieten. In Zusammenarbeit mit AWS entwickelten sie einen KI-Agenten, der Händlern eine Suche im Bestand mittels natürlichsprachlicher Abfragen anstelle manueller Filterung ermöglicht. Der Agent stellt acht Werkzeuge bereit, die strukturierte Filterung über 89 Fahrzeugattribute mit vektorbasierter Ähnlichkeitssuche über LanceDB und Amazon Titan Text Embeddings V2 kombinieren. Um die Zuverlässigkeit zu gewährleisten, entwickelten sie eine zweistufige Evaluierungsstrategie: Build-Time-Tests mit „strands-agents-evals“ und Produktionsüberwachung mit Amazon Bedrock AgentCore Evaluations. Ein dreischichtiges Framework bewertet die Werkzeugnutzung (Schwellwert über 95 %), die Argumentation (über 85 %) und die Ausgabequalität (über 90 %). Eine pass^k-Metrik behandelt die Nichtdeterminiertheit: Bei kundenorientierten Agenten ist vor allem der Erfolg aufeinanderfolgender Versuche entscheidend. Die Pipeline reduzierte fehlerhafte Ergebnisse von 1 von 8 Abfragen auf 1 von 50 und verkürzte die Fehlererkennungszeit von Stunden auf Minuten. Ein Begleit-Repository bietet eine einsetzbare Blaupause, die sich an andere Agenten anpassen lässt.
Quelle: AWS ML blog —
Original
