AI एजेंटों का मूल्यांकन: AWS और Motorway से Strands और AgentCore के साथ एक उत्पादन ब्लूप्रिंट

Amazon/AWSAmazon/AWS Amazon Web ServicesAmazon Web Services AnthropicAnthropic
UK की ऑनलाइन कार मार्केटप्लेस Motorway ने AWS के साथ मिलकर एक AI-संचालित डीलर स्टॉक सर्च एजेंट बनाया। उन्होंने Strands Agents SDK और Amazon Bedrock AgentCore को मिलाकर एक मूल्यांकन पाइपलाइन विकसित की, जिससे गलत परिणाम 8 क्वेरी में से 1 से घटकर 50 में से 1 हो गए और समस्या का पता लगने का समय घंटों से मिनटों में आ गया। इस ब्लूप्रिंट में टूल उपयोग, तर्क और आउटपुट गुणवत्ता के लिए तीन-स्तरीय मूल्यांकन ढांचा शामिल है, जिसमें गुणवत्ता गेट्स मीट्रिक सीमा से नीचे होने पर डिप्लॉयमेंट को रोकते हैं।
Motorway एक दैनिक नीलामी चलाता है जहाँ 8,000 तक डीलर 2,500 वाहनों पर बोली लगाते हैं। AWS के साथ काम करते हुए, उन्होंने एक AI एजेंट बनाया जो डीलरों को मैन्युअल फ़िल्टरिंग के बजाय प्राकृतिक भाषा क्वेरी का उपयोग करके स्टॉक खोजने देता है। एजेंट आठ टूल्स को उजागर करता है जो 89 वाहन विशेषताओं पर संरचित फ़िल्टरिंग को LanceDB और Amazon Titan Text Embeddings V2 के माध्यम से वेक्टर समानता खोज के साथ जोड़ते हैं। विश्वसनीयता सुनिश्चित करने के लिए, उन्होंने एक दो-चरणीय मूल्यांकन रणनीति बनाई: strands-agents-evals के साथ बिल्ड-टाइम परीक्षण और Amazon Bedrock AgentCore Evaluations के साथ उत्पादन निगरानी। एक तीन-परत वाला ढाँचा टूल उपयोग (95% से अधिक थ्रेसहोल्ड), तर्क (85% से अधिक), और आउटपुट गुणवत्ता (90% से अधिक) का आकलन करता है। एक pass^k मीट्रिक गैर-नियतात्मकता को संभालता है: ग्राहक-सामना करने वाले एजेंटों के लिए, लगातार परीक्षण सफलता सबसे महत्वपूर्ण है। पाइपलाइन ने गलत परिणामों को 8 क्वेरी में 1 से घटाकर 50 में 1 कर दिया और समस्या का पता लगाने के समय को घंटों से मिनटों तक कम कर दिया। एक साथी रिपॉजिटरी एक डिप्लॉयेबल ब्लूप्रिंट प्रदान करती है जो अन्य एजेंटों के लिए अनुकूलनीय है।
स्रोत: AWS ML blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार