الأبحاث 🇺🇸 27.07.2026 17:04

تعلم التعزيز بدون تعلم الفرق الزمني: خوارزمية فرق تسد جديدة

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
يقترح الباحثون خوارزمية تعزيز انتقالية (TRL)، وهي خوارزمية تعلم تعزيز جديدة تعتمد على فرق تسد وتتجنب تعلم الفرق الزمني. تتوسع TRL في المهام طويلة المدى عن طريق تقسيم المسارات بشكل متكرر، محققة نتائج متطورة على معايير صعبة دون الحاجة إلى ضبط معامل الخطوة n.
تم تقديم خوارزمية جديدة للتعلم المعزز (Reinforcement Learning) تُدعى Transitive RL (TRL)، تقوم على مبدأ "فرّق تسُد" بدلاً من أسلوب التعلم بالفرق الزمني التقليدي (Temporal Difference - TD). يعاني التعلم بالفرق الزمني من تراكم الأخطاء على مدى الآفاق الزمنية الطويلة، وبينما يُقلّل أسلوب n-step TD من هذا التراكم بشكل خطي، فإنه يتطلب ضبطًا دقيقًا لقيمة n. أما TRL فيُقلّل عدد تكرارات بيلمان (Bellman) بشكل لوغاريتمي عبر تقسيم المسارات تكراريًا إلى مقاطع متساوية الطول ثم دمج قيمها. عمليًا، تقتصر خوارزمية TRL في بحثها عن الأهداف الفرعية على الحالات الموجودة في مجموعة البيانات، وتستخدم انحدار الإكسبكتايل (Expectile Regression) لتفادي المبالغة في التقدير. وعند تقييمها على أصعب مهام humanoidmaze وpuzzle في OGBench (التي تصل إلى 3000 خطوة)، حققت TRL أفضل أداء بين مجموعة من الأساليب المرجعية القوية، وضاهت أفضل نسخة مضبوطة يدويًا من n-step TD دون الحاجة إلى ضبط قيمة n. وتفترض الطريقة حاليًا ديناميكيات حتمية، وتقتصر على التعلم المعزز المشروط بالهدف، إلا أن الأعمال المستقبلية قد تُوسّع نطاقها لتشمل المهام القائمة على المكافآت والبيئات العشوائية.
المصدر: BAIR (Berkeley AI) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة