शोध 🇺🇸 27.07.2026 17:04

टीडी लर्निंग के बिना आरएल: नया डिवाइड एंड कॉन्कर एल्गोरिदम

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
शोधकर्ताओं ने ट्रांज़िटिव आरएल (TRL) प्रस्तावित किया है, जो एक नया डिवाइड-एंड-कॉन्कर रीइन्फोर्समेंट लर्निंग एल्गोरिदम है जो टेम्पोरल डिफरेंस लर्निंग से बचता है। TRL ट्रैजेक्टरीज़ को पुनरावर्ती रूप से विभाजित करके लंबे-क्षितिज वाले कार्यों के लिए स्केल करता है, और चुनौतीपूर्ण बेंचमार्क पर स्टेप पैरामीटर n को ट्यून किए बिना अत्याधुनिक परिणाम प्राप्त करता है।
एक नया सुदृढ़ीकरण सीखने (reinforcement learning) का एल्गोरिदम, जिसे ट्रांज़िटिव आरएल (TRL) कहा जाता है, पेश किया गया है। यह पारंपरिक टेम्पोरल डिफरेंस (temporal difference, TD) सीखने के बजाय विभाजन-और-जीत (divide-and-conquer) प्रतिमान पर आधारित है। टीडी सीखने में लंबे क्षितिजों पर त्रुटि संचय (error accumulation) की समस्या होती है, और जहां एन-स्टेप टीडी इसे रैखिक रूप से कम करता है, वहां इसके लिए एन के सावधानीपूर्वक समायोजन (tuning) की आवश्यकता होती है। टीआरएल बेलमैन पुनरावृत्तियों (Bellman recursions) की संख्या को लॉगरिद्मिक रूप से कम करता है, प्रक्षेपवक्रों (trajectories) को समान लंबाई के खंडों में पुनरावर्ती रूप से विभाजित करके और उनके मानों को संयोजित करके। व्यवहार में, टीआरएल उप-लक्ष्य (subgoal) खोज को डेटासेट अवस्थाओं तक सीमित करता है और अतिअनुमान (overestimation) से बचने के लिए एक्सपेक्टाइल रिग्रेशन (expectile regression) का उपयोग करता है। ओजीबेंच (OGBench) के सबसे कठिन ह्यूमनॉइडमेज़ (humanoidmaze) और पज़ल (puzzle) कार्यों (3000 कदमों तक) पर मूल्यांकन में, टीआरएल ने मजबूत आधारभूत मॉडलों (baselines) में सर्वश्रेष्ठ प्रदर्शन प्राप्त किया और एन समायोजन की आवश्यकता के बिना सर्वश्रेष्ठ व्यक्तिगत रूप से समायोजित एन-स्टेप टीडी से मेल खाया। यह विधि वर्तमान में नियतात्मक गतिशीलता (deterministic dynamics) मानती है और लक्ष्य-शर्तयुक्त सुदृढ़ीकरण सीखने (goal-conditioned RL) तक सीमित है, लेकिन भविष्य के कार्य इसे पुरस्कार-आधारित कार्यों (reward-based tasks) और स्टोकास्टिक वातावरणों (stochastic environments) तक विस्तारित कर सकते हैं।
स्रोत: BAIR (Berkeley AI) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार