GRASP: Bộ Lập Kế Hoạch Dựa Trên Gradient Mới Cho Lập Kế Hoạch Tầm Xa Trong Mô Hình Thế Giới
Berkeley Artificial Intelligence Research (BAIR)
Các nhà nghiên cứu từ BAIR đề xuất GRASP, một bộ lập kế hoạch dựa trên gradient giải quyết các thách thức trong lập kế hoạch tầm xa với các mô hình thế giới đã học. Nó nâng tối ưu hóa quỹ đạo lên các trạng thái ảo song song, đưa vào tính ngẫu nhiên để khám phá và định hình lại gradient để tránh gradient đầu vào trạng thái mong manh.
GRASP là một phương pháp lập kế hoạch mới dựa trên gradient cho các mô hình động lực học đã được học (mô hình thế giới), giúp lập kế hoạch trong dài hạn trở nên khả thi bằng cách: (1) nâng quỹ đạo lên các trạng thái ảo để tối ưu hóa song song theo thời gian, (2) thêm tính ngẫu nhiên trực tiếp vào các bước lặp trạng thái để khám phá, và (3) định hình lại gradient sao cho các hành động nhận được tín hiệu rõ ràng trong khi tránh các gradient 'đầu vào-trạng thái' mong manh qua các mô hình thị giác chiều cao. Các mô hình thế giới lớn đã học ngày càng có năng lực, nhưng lập kế hoạch trong dài hạn vẫn mong manh do đồ thị tính toán không được điều kiện hóa tốt, các bề mặt không tham lam với các cực tiểu địa phương xấu, và các không gian tiềm ẩn chiều cao tạo ra các chế độ hỏng hóc tinh vi. Các tác giả từ BAIR, bao gồm Mike Rabbat, Aditi Krishnapriyan, Yann LeCun và Amir Bar, đề xuất GRASP để giải quyết các vấn đề này. Bộ lập kế hoạch xây dựng một phương pháp trạng thái nâng bậc nhất (first-order lifted state) chỉ phụ thuộc vào các ma trận Jacobian của hành động thông qua mô hình thế giới, khai thác tính khả vi trong khi tránh độ nhạy của các ma trận Jacobian trạng thái.
Nguồn: BAIR (Berkeley AI) —
bản gốc
