Adobe Research cùng các nhà khoa học Stanford và Princeton đề xuất Mô hình Thế giới Video với Bộ nhớ Dài hạn dựa trên Mô hình Không gian Trạng thái
Princeton University (Sengupta Lab)
Các nhà nghiên cứu từ Đại học Stanford, Đại học Princeton và Adobe Research đã phát triển một kiến trúc mô hình thế giới video mới có tên LSSVWM sử dụng Mô hình Không gian Trạng thái (SSM) để mở rộng bộ nhớ tạm thời một cách hiệu quả. Mô hình này giải quyết chi phí tính toán bậc hai của cơ chế chú ý bằng cách sử dụng quét SSM theo khối và chú ý cục bộ dày đặc, cho phép bộ nhớ dài hạn cho các nhiệm vụ như truy xuất không gian và lý luận trong môi trường Minecraft và Memory Maze.
Một bài báo mới, "Long-Context State-Space Video World Models" do các nhà nghiên cứu từ Đại học Stanford, Đại học Princeton và Adobe Research thực hiện, đề xuất một giải pháp cho nút thắt cổ chai về bộ nhớ dài hạn trong các mô hình thế giới video. Vấn đề cốt lõi là các tầng attention truyền thống có độ phức tạp tính toán bậc hai theo độ dài chuỗi, khiến cho bộ nhớ dài hạn trở nên bất khả thi. Các tác giả giới thiệu Long-Context State-Space Video World Model (LSSVWM), tận dụng các Mô hình Không gian Trạng thái (State-Space Models, SSM) để mô hình hóa chuỗi nhân quả hiệu quả. Các lựa chọn thiết kế chính bao gồm sơ đồ quét SSM theo khối, đánh đổi một phần tính nhất quán không gian để có bộ nhớ thời gian mở rộng, và attention cục bộ dày đặc để duy trì các chi tiết tinh tế. Hai chiến lược huấn luyện, Diffusion Forcing và Frame Local Attention, cải thiện thêm hiệu suất ngữ cảnh dài. Các đánh giá trên tập dữ liệu Memory Maze và Minecraft cho thấy LSSVWM vượt trội đáng kể so với các baseline trong việc duy trì bộ nhớ dài hạn trong khi vẫn giữ tốc độ suy luận thực tế.
Nguồn: Synced —
bản gốc
