العواملالأعمال والسوق 🇺🇸 23.07.2026 23:49

تقييم وكلاء الذكاء الاصطناعي: قالب إنتاجي باستخدام Strands و AgentCore من AWS و Motorway

Amazon/AWSAmazon/AWS Amazon Web ServicesAmazon Web Services AnthropicAnthropic
طورت Motorway، سوق السيارات عبر الإنترنت في بريطانيا، بالتعاون مع AWS، خط أنابيب لتقييم وكلاء الذكاء الاصطناعي للبحث عن السيارات من التجار. قلل الحل من النتائج غير الصحيحة من 1 من كل 8 استعلامات إلى 1 من كل 50 استعلامًا، وقلص وقت تحديد المشكلات من عدة ساعات إلى بضع دقائق. يعتمد في جوهره على استراتيجية تقييم على مرحلتين باستخدام Strands Agents SDK و Amazon Bedrock AgentCore.
Motorway, سوق السيارات البريطاني عبر الإنترنت حيث يتنافس يوميًا ما يصل إلى 8000 تاجر على 2500 سيارة، تعاون مع AWS PACE لإنشاء وكيل ذكاء اصطناعي للبحث عن السيارات في مخزون التجار. يستخدم الوكيل ثماني أدوات، يجمع بين التصفية المنظمة عبر 89 سمة والبحث المتجهي المعتمد على LanceDB و Amazon Titan Text Embeddings V2. لضمان موثوقية الوكيل، بنت Motorway و AWS خط أنابيب تقييم خفض نسبة النتائج غير الصحيحة من 1 من أصل 8 إلى 1 من أصل 50 استعلامًا، وقلص وقت اكتشاف المشكلات من عدة ساعات إلى عدة دقائق. يتضمن خط الأنابيب استراتيجية من مرحلتين: الاختبار أثناء البناء باستخدام مكتبة strands-agents-evals والمراقبة في الإنتاج باستخدام Amazon Bedrock AgentCore Evaluations. يتم التقييم عبر ثلاثة مستويات: استخدام الأدوات (عتبة >95%)، منطق الاستدلال (>85%)، وجودة المخرجات (>90%). لمكافحة عدم الحتمية في نماذج اللغة الكبيرة، تُطبق مقياس pass^k الذي يمثل احتمال النجاح في k محاولة متتالية. يتضمن خط الأنابيب خمس مراحل نشر مع بوابات جودة. يوفر المستودع المصاحب قالبًا قابلًا للنشر يمكن تكييفه مع وكلاء آخرين.
المصدر: AWS ML blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة