لماذا الوكيل الذكي أرخص بالفعل من RAG
على الرغم من أن المساعد الكلاسيكي القائم على RAG يبدو أرخص لكل استعلام، إلا أن التكاليف الخفية مثل متابعات المستخدمين وتصعيد المشغلين تجعله أكثر تكلفة بشكل عام. يستخدم الوكيل الذكي حلقة ReAct للبحث بشكل مستقل في مستندات متعددة حتى يجد الإجابة الكاملة، مما يحول عملية تستغرق 3 محاولات و27 دقيقة إلى إجابة واحدة تستغرق 4 دقائق. تؤكد بيانات تجريبية حقيقية من مشروع دعم أن الوكلاء يغلقون الأسئلة بتكلفة تبلغ ثلث تكلفة مساعد RAG.
تجادل المقالة بأن المقارنة الساذجة للتكاليف بين مساعد RAG وعامل آلي مضللة. مساعد RAG التقليدي يقوم باستدعاء واحد لنموذج اللغة الكبير ويعتمد على المستخدم لتحسين الاستعلام إذا كانت الإجابة خاطئة. في الممارسة العملية، غالبًا ما يستسلم المستخدمون بعد 2-3 محاولات، مما يؤدي إلى تصعيد المشكلة إلى مشغل بشري يقضي 10-15 دقيقة في حل الحالة. هذا يصل في النهاية إلى أكثر بكثير من استدعاء واحد لنموذج اللغة الكبير. العامل الآلي القائم على حلقة ReAct يكرر بشكل مستقل عبر أدوات البحث، ويضع الفرضيات، ويسترد القطع النصية، ويجمع الإجابة النهائية دون تدخل المستخدم. يستخدم العامل الآلي ISTOK الخاص بالمؤلف خمس أدوات: VectorSearch (بحث هجين بين التشابه الدلالي الكثيف وBM25 عبر ميلفوس)، وSearch (بحث نصي كامل عبر PostgreSQL)، وOpenChunk لقراءة القطع النصية الكاملة للوثائق، وGetDocumentChucks لجداول المحتويات، وCallOperator كملاذ أخير بعد 2-3 محاولات خاصة به. لإدارة حدود نافذة السياق، جرب العامل الآلي أولاً تلخيص نموذج اللغة الكبير لكنه وجده مكلفًا وغير موثوق؛ ويستخدم الآن نافذة منزلقة (الاحتفاظ بآخر 6 رسائل، وإسقاط أقدم رسائل الأدوات) مع التلخيص كحل احتياطي (بحد أقصى مرتين لكل جلسة). كما تم تمييز استدعاءات نموذج اللغة الكبير: التضمينات وإعادة الترتيب الرخيصة، والتوليد الخفيف للخطوات البسيطة، والمتوسط للاستدلال النموذجي، والثقيل فقط للتوليف النهائي أو التلخيص. في تجربة تجريبية حقيقية مع حوالي 1200 وثيقة و1800 طلب شهريًا، بلغ متوسط المساعد استدعاءً واحدًا لنموذج اللغة الكبير، و2.3 متابعة من المستخدم، ومعدل تصعيد 34%، و27 دقيقة للإغلاق، وحوالي 18.000 رمز لكل سؤال مغلق. بلغ متوسط العامل الآلي 6.4 استدعاءات لنموذج اللغة الكبير، و0.3 متابعة، ومعدل تصعيد 11%، و4 دقائق للإغلاق، وحوالي 15.500 رمز. من حيث التكلفة المباشرة، بلغت تكلفة السؤال المغلق للمساعد حوالي 52 روبل (بما في ذلك تكلفة المشغل)، بينما بلغت تكلفة العامل الآلي حوالي 17 روبل، أي انخفاض بمقدار ثلاثة أضعاف. تختفي ميزة العامل الآلي بالنسبة للأسئلة الواقعية البسيطة أو عندما تكون قاعدة المعرفة فارغة، حيث يضيع التكرارات. يسجل العامل الآلي استخدام الرموز لكل استدعاء وسجل الأدوات، مع التتبع عبر Arize Phoenix لتحليل مفصل للتكرارات.
المصدر: Habr — хаб ИИ —
الأصلي
