Riset 🇺🇸 27.07.2026 17:04

RL tanpa TD Learning: Algoritma Divide and Conquer Baru

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Peneliti mengusulkan Transitive RL (TRL), algoritma pembelajaran penguatan baru yang menggunakan pendekatan divide-and-conquer tanpa memerlukan temporal difference learning. TRL dapat diperluas untuk tugas dengan rentang waktu panjang dengan cara memecah lintasan secara rekursif, mencapai hasil yang unggul pada tolok ukur yang menantang tanpa perlu menyesuaikan parameter langkah n.
Algoritma pembelajaran penguatan baru yang disebut Transitive RL (TRL) telah diperkenalkan, berdasarkan paradigma bagi-dan-taklukkan, bukan pembelajaran perbedaan temporal (TD) tradisional. Pembelajaran TD mengalami akumulasi kesalahan dalam jangka waktu yang panjang, dan meskipun TD n-langkah mengurangi hal ini secara linear, metode tersebut memerlukan penyesuaian yang cermat terhadap n. TRL mengurangi jumlah rekursi Bellman secara logaritmik dengan memisahkan lintasan secara rekursif menjadi segmen-segmen yang sama panjang dan menggabungkan nilainya. Secara praktis, TRL membatasi pencarian subgoal pada status data dan menggunakan regresi ekspektil untuk menghindari estimasi berlebihan. Dievaluasi pada tugas humanoidmaze dan puzzle tersulit OGBench (hingga 3000 langkah), TRL mencapai kinerja terbaik di antara garis dasar yang kuat dan menyamai TD n-langkah terbaik yang disetel secara individual tanpa memerlukan penyesuaian n. Metode ini saat ini mengasumsikan dinamika deterministik dan terbatas pada pembelajaran penguatan yang dikondisikan oleh tujuan, tetapi penelitian di masa mendatang dapat diperluas ke tugas berbasis imbalan dan lingkungan stokastik.
Sumber: BAIR (Berkeley AI) — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru