العوامل 🇨🇳 07.08.2026 11:02

مايكروسوفت تكشف عن بنية توجيه وكلاء الذكاء الاصطناعي على AKS، مما يخفض التكاليف بنسبة تصل إلى 85%

MicrosoftMicrosoft OpenAIOpenAI RouteLLMRouteLLM
نشرت مايكروسوفت بنية مرجعية لتوجيه حركة الوكلاء على خدمة Azure Kubernetes (AKS)، تجمع بين RouteLLM للتوجيه الدلالي، وagentgateway للإدارة، وKubernetes Gateway API Inference Extension لموازنة الحمل الواعي بوحدات معالجة الرسوميات. يستهدف التصميم أعباء العمل الوكيلة، حيث لا تتطلب العديد من استدعاءات نماذج اللغة الكبيرة نماذج متطورة، مما قد يوفر ما يصل إلى 85% من التكاليف. ومع ذلك، تعتمد التوفيرات على معايرة أزواج النماذج ونضج المكونات.
نشرت مايكروسوفت بنية مرجعية لتوجيه حركة مرور الوكلاء (agents) على خدمة Kubernetes من Azure (AKS)، حيث قسمت المشكلة إلى ثلاثة خيارات رئيسية: أي نموذج يستجيب للاستدعاء، وكيف تتم إدارة الاستدعاء، وأي نسخة GPU تعالجه. يجمع التصميم بين امتداد Kubernetes Gateway API للاستدلال (Inference Extension) لموازنة التحميل، و agentgateway كوكيل ذكاء اصطناعي، و RouteLLM للتوجيه الدلالي، وكلها متصلة بنقطة نهاية متوافقة مع OpenAI. هذا مصمم خصيصًا لأحمال عمل الوكلاء وليس للدردشة البسيطة، لأن مهمة وكيل واحدة يمكن أن تؤدي إلى مئات استدعاءات نماذج اللغة الكبيرة (LLM) في حلقة تخطيط-تنفيذ-ملاحظة، ومعظم هذه الاستدعاءات (ملء وسيطات الأدوات، قرارات نعم/لا، الملخصات) لا تتطلب نموذجًا رائدًا. يفحص RouteLLM المطالبة (prompt) ويتنبأ ما إذا كان نموذج أرخص يمكن أن يطابق جودة نموذج أقوى، باستخدام موجه تحليل مصفوفي (matrix factorization router) مدرب على بيانات تفضيلات بشرية. agentgateway، وهو وكيل مفتوح المصدر متوافق مع OpenAI، يدير المصادقة، وحدود المعدل لكل وكيل، وتتبع التكاليف، والحواجز الواقية دون فحص محتوى المطالبة. يتحقق Endpoint Picker في امتداد Gateway API للاستدلال من حالة GPU في الوقت الفعلي، بما في ذلك استخدام ذاكرة التخزين المؤقت KV الخاصة بـ vLLM وعمق قائمة الانتظار، ليقرر أي نسخة من النموذج المحدد تعالج الطلب. للمسارات المستضافة ذاتيًا، يستدعي agentgateway Endpoint Picker عبر ext-proc، متجاوزًا بوابة Gateway API منفصلة. يوفر KAITO مجموعات عقد GPU عند الطلب ويشغل vLLM، مما يعرض مقاييس مثل vllm:num_requests_waiting و vllm:kv_cache_usage_perc. يمر مسار النموذج القوي عبر الخلفية الذكية لـ agentgateway إلى Azure OpenAI، بينما يمر مسار النموذج الضعيف عبر خلفية خدمة إلى وحدات KAITO. تقوم Prometheus و Grafana المُدارة من Azure بجمع مقاييس التوجيه والتكلفة و GPU لعرض موحد. رقم رئيسي هو عتبة الترقية في RouteLLM: على أزواج النماذج المختبرة، حقق موجه mf حوالي 95% من جودة GPT-4 على MT-Bench بينما أرسل حوالي 26% فقط من الاستدعاءات إلى GPT-4، مما يوفر ما يصل إلى 85% في التكاليف. تحذر مايكروسوفت من أن هذا الرقم ليس تلقائيًا ويعتمد على زوج النماذج المستخدم لتدريب RouteLLM؛ يجب على المستخدمين معايرة العتبات بناءً على حركة المرور الفعلية. يؤدي التخزين المؤقت للمطالبات إلى تعقيد تكاليف الرموز، حيث تحصل ضربات ذاكرة التخزين المؤقت على خصومات، ويؤدي تبديل النماذج إلى تبريد ذاكرات التخزين المؤقت على كلا الجانبين. تحذر المقالة من أن المكونات حديثة؛ تتغير الحقول بين الإصدارات—أعيدت تسمية Inference Extension وأعيد هيكلة موارد CRD قبل الإصدار v1. تم التحقق من كل شيء في منتصف 2026 على AKS مع Inference Extension v1.0.0 و agentgateway v1.3.1. يمكن للفرق اعتماد البنية على مراحل: للنماذج المُدارة مع عدد قليل من الوكلاء، يكفي حوكمة agentgateway؛ للنموذج الفردي المستضاف ذاتيًا، يكفي KAITO و Inference Extension دون توجيه دلالي؛ يكون RouteLLM مفيدًا عندما يكون هناك فرق واضح في السعر بين النماذج القوية والضعيفة وحركة مرور بسيطة كبيرة، وهذا ينطبق على جميع الوكلاء الدائريين تقريبًا.
المصدر: InfoQ 中国 — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة