العواملالأعمال والسوق 🇺🇸 23.07.2026 23:49

تقييم وكلاء الذكاء الاصطناعي: مخطط إنتاجي مع Strands وAgentCore من AWS وMotorway

Amazon/AWSAmazon/AWS Amazon Web ServicesAmazon Web Services AnthropicAnthropic
تعاونت Motorway، سوق السيارات الإلكتروني في المملكة المتحدة، مع AWS لبناء وكيل بحث عن تجار سيارات مدعوم بالذكاء الاصطناعي. طوروا خط أنابيب تقييم يجمع بين Strands Agents SDK وAmazon Bedrock AgentCore، مما قلل النتائج غير الصحيحة من 1 من كل 8 استعلامات إلى 1 من كل 50، وخفض وقت اكتشاف المشكلات من ساعات إلى دقائق. يتضمن المخطط إطار تقييم ثلاثي المستويات لاستخدام الأدوات والاستدلال وجودة المخرجات، مع بوابات جودة تمنع النشر عندما تنخفض المقاييس دون العتبات المحددة.
تدير موتورواي مزادًا يوميًا يقدم فيه ما يصل إلى 8000 تاجر عروضًا على ما يصل إلى 2500 مركبة. وبالتعاون مع AWS، طورت الشركة وكيل ذكاء اصطناعي يتيح للتجار البحث في المخزون باستخدام استعلامات اللغة الطبيعية بدلاً من التصفية اليدوية. يعرض الوكيل ثماني أدوات تجمع بين التصفية المنظمة عبر 89 سمة للمركبة والبحث التشابهي المتجهي عبر LanceDB و Amazon Titan Text Embeddings V2. لضمان الموثوقية، أنشأت الشركة استراتيجية تقييم من مرحلتين: الاختبار أثناء البناء باستخدام agents-evals (strands-agents-evals) والمراقبة الإنتاجية باستخدام Amazon Bedrock AgentCore Evaluations. يقوم إطار عمل ثلاثي المستويات بتقييم استخدام الأداة (بحد أعلى 95% تقريبًا)، والاستدلال (أكثر من 85%)، وجودة المخرجات (أكثر من 90%). يتعامل مقياس pass^k مع اللاحتمية: بالنسبة للوكلاء المواجهين للعملاء، يكون النجاح المتتالي في المحاولات هو الأكثر أهمية. خفضت الأنابيب النتائج غير الصحيحة من حالة واحدة لكل 8 استعلامات إلى حالة واحدة لكل 50 استعلامًا، وقلصت وقت اكتشاف المشكلات من ساعات إلى دقائق. يوفر مستودع مصاحب مخططًا جاهزًا للنشر يمكن تكييفه لوكلاء آخرين.
المصدر: AWS ML blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة