Học Tăng Cường không có Học Chênh Lệch Thời Gian: Thuật toán Chia để Trị Mới
Berkeley Artificial Intelligence Research (BAIR)
Các nhà nghiên cứu đề xuất Transitive RL (TRL), một thuật toán học tăng cường chia để trị mới tránh việc học chênh lệch thời gian. TRL mở rộng quy mô cho các tác vụ dài hạn bằng cách đệ quy phân tách quỹ đạo, đạt kết quả tiên tiến nhất trên các điểm chuẩn thách thức mà không cần điều chỉnh tham số bước n.
Một thuật toán học tăng cường mới có tên là Transitive RL (TRL) đã được giới thiệu, dựa trên mô hình chia để trị thay vì học chênh lệch thời gian (temporal difference - TD) truyền thống. Học TD gặp vấn đề tích lũy lỗi qua các khoảng thời gian dài, và trong khi TD n-bước giảm thiểu điều này một cách tuyến tính, nó đòi hỏi phải tinh chỉnh n một cách cẩn thận. TRL giảm số lần đệ quy Bellman theo hàm logarit bằng cách đệ quy chia các quỹ đạo thành các đoạn có độ dài bằng nhau và kết hợp giá trị của chúng. Trong thực tế, TRL giới hạn việc tìm kiếm mục tiêu con trong các trạng thái của tập dữ liệu và sử dụng hồi quy phân vị (expectile regression) để tránh đánh giá quá cao. Khi được đánh giá trên các tác vụ humanoidmaze và puzzle khó nhất của OGBench (lên tới 3000 bước), TRL đã đạt được hiệu suất tốt nhất trong số các baseline mạnh và sánh ngang với TD n-bước được tinh chỉnh riêng lẻ tốt nhất mà không cần tinh chỉnh n. Phương pháp này hiện giả định động lực học tất định và chỉ giới hạn trong học tăng cường có điều kiện mục tiêu (goal-conditioned RL), nhưng các nghiên cứu trong tương lai có thể mở rộng sang các tác vụ dựa trên phần thưởng và môi trường ngẫu nhiên.
Nguồn: BAIR (Berkeley AI) —
bản gốc
