تعلم التعزيز بدون تعلم تي دي: خوارزمية جديدة 'فرق تسد'
قدم باحثون من باير (بيركلي للذكاء الاصطناعي) خوارزمية التعزيز الانتقالي (TRL) القائمة على نموذج 'فرق تسد' للتعلم التعزيزي خارج السياسة (off-policy). تعمل TRL على تقليل عدد تكرارات بلمان لوغاريتمياً، مما يتجنب مشاكل تراكم الأخطاء النموذجية في تعلم تي دي. أظهرت الخوارزمية نتائج متفوقة في المهام المعقدة طويلة الأمد دون الحاجة إلى ضبط المعامل الفائق n كما في تي دي ذي الخطوات n.
Berkeley Artificial Intelligence Research (BAIR)
