PEVA: Dự đoán video chủ quan từ hành động toàn thân
Berkeley Artificial Intelligence Research (BAIR)
Các nhà nghiên cứu từ BAIR (Berkeley AI) giới thiệu PEVA, một mô hình dự đoán các khung hình video chủ quan (egocentric) từ các hành động toàn thân của con người. Mô hình sử dụng một bộ biến đổi khuếch tán có điều kiện tự hồi quy được huấn luyện trên bộ dữ liệu Nymeria, cho phép tổng hợp hành động nguyên tử, mô phỏng phản thực tế và tạo video dài. PEVA cũng có thể được sử dụng cho lập kế hoạch trực quan bằng cách tối ưu hóa các chuỗi hành động.
PEVA (Predicting Ego-centric Video from human Actions) là một mô hình do BAIR phát triển, tạo ra các khung hình video tự trung tâm trong tương lai dựa trên các khung hình quá khứ và một chuỗi các hành động toàn thân được biểu diễn dưới dạng quỹ đạo tư thế động học 48 chiều. Nó mở rộng Conditional Diffusion Transformer (CDiT) với các bước nhảy thời gian ngẫu nhiên, huấn luyện theo mức độ chuỗi và các nhúng hành động. Được huấn luyện trên bộ dữ liệu Nymeria, kết hợp video tự trung tâm với ghi lại tư thế cơ thể, PEVA có thể mô phỏng các hành động nguyên tử, các tình huống phản thực tế và các đoạn video dài tới 16 giây. Nó cũng hỗ trợ lập kế hoạch bằng cách tối ưu hóa các chuỗi hành động sử dụng Phương pháp Cross-Entropy để giảm thiểu độ tương tự tri giác (LPIPS) với một hình ảnh mục tiêu. Mô hình này vượt trội hơn các mô hình cơ sở về chất lượng tri giác và thể hiện các đặc tính mở rộng theo kích thước mô hình.
Nguồn: BAIR (Berkeley AI) —
bản gốc
