Meta AI تقترح وكيل ذكاء اصطناعي ثانٍ لإبقاء المهام الطويلة على المسار الصحيح
Meta
Anthropic
طوّر باحثو Meta AI وحدة ذاكرة تستخدم 'وكيل ذاكرة' منفصلاً لحقن تذكيرات بشكل انتقائي في 'وكيل الإجراءات' أثناء المهام الطويلة، مما يمنع 'تدهور الحالة السلوكية'. أظهرت الاختبارات على Terminal-Bench 2.0 وτ2-Bench تحسينات كبيرة، خاصة للوكلاء الأضعف، وقد تم فتح الكود المصدري على GitHub.
في ورقتهم البحثية، يصف باحثو Meta AI مشكلة متكررة حيث تفقد الوكلاء الاصطناعيون تتبع المتطلبات أو يكررون إجراءات فاشلة على مدى المهام الطويلة، وهي ظاهرة يسمونها 'تدهور الحالة السلوكية'. يقترحون وحدة ذاكرة قابلة للتركيب والتشغيل تدير 'وكيل ذاكرة' منفصلاً إلى جانب 'وكيل إجراءات' غير معدل، يراقب الخطوات الأخيرة على فترات زمنية محددة، ويحدث بنك ذاكرة منظم، ويقرر ما إذا كان سيحقن تذكيرًا موجزًا قائمًا على الذاكرة في استدعاء الإجراء التالي أو يبقى صامتًا. ينقسم بنك الذاكرة إلى ذاكرة الحالة الخاصة، والذاكرة المعرفية، والذاكرة الإجرائية، ويدير الوكيل البنك من خلال استدعاءات أدوات محددة مسبقًا بدلاً من إعادة الكتابة الحرة. أُجريت الاختبارات على Terminal-Bench 2.0 و τ2-Bench باستخدام Claude Opus 4.6 كوكيل ذاكرة. مع Claude Sonnet 4.5 كوكيل إجراءات، حل النظام 46٪ من مهام Terminal-Bench من المحاولة الأولى، بزيادة من 38٪، وحسّن المتوسط المرجح للمهام في τ2-Bench من 55٪ إلى 62٪، مع وجود اختلافات ملحوظة بين المجالات: تحسنت مجالات الطيران والتجزئة بحوالي 10 نقاط مئوية لكل منهما، بينما تحسنت الاتصالات بنسبة 3 فقط. كما أدى Opus 4.6 الأقوى إلى تحسين ولكن بدرجة أقل، مما يشير إلى أن الفائدة تتجاوز مجرد تعويض السعة المحدودة. أظهرت عمليات الإزالة أن التدخل الانتقائي والذاكرة المحفوظة هما العاملان الرئيسيان، وتفوق هذا النهج على طبقة الذاكرة الإنتاجية Mem0. كما استكشف الفريق تدريب نموذج مفتوح، Qwen3.5-27B، كوكيل ذاكرة، ووجدوا أن الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي كانا ضروريين لمعايرة التدخلات بشكل صحيح. نشرت Meta AI الكود على GitHub.
المصدر: The Decoder (DE) —
الأصلي
