Chúng tôi đã đánh bại bộ lọc Kalman trên một camera đơn, nhưng trước tiên đã dành ba tuần để đo một xác chết
Các kỹ sư của MoranaLabs đã phát triển một bộ theo dõi nơ-ron vượt trội hơn bộ lọc Kalman cổ điển trên camera đơn, giữ mục tiêu mù trong 50% số tập so với -3% của Kalman. Sự kết hợp giữa KalmanNet và mạng nơ-ron đạt tỷ lệ quay lại khung hình 80%. Tuy nhiên, dự án đã gặp phải các lỗi đo lường, bao gồm một đầu dò bị hỏng đọc số không trong nhiều tuần.
Dự án tại MoranaLabs nhằm mục tiêu duy trì khóa hình ảnh (visual lock) lên một mục tiêu biến mất khỏi khung hình camera trong 0,75 giây, chỉ sử dụng một camera đơn sắc (monocular) mà không có máy đo khoảng cách. Bộ lọc Kalman kinh điển để mất mục tiêu trong 84% số lần thử, trong khi bộ theo dõi lai kết hợp KalmanNet với mạng nơ-ron chỉ mất mục tiêu trong 18% số lần và đưa mục tiêu trở lại trung tâm trong 80% số lần. Ban đầu, nhóm đã viết một chính sách huấn luyện (teacher policy) với lỗi sai dấu, khiến hệ thống trượt cả 60 lần thử. Họ đã mất ba tuần để gỡ lỗi các chỉ số đo lường, và phát hiện ra rằng môi trường mô phỏng ghi một số chỉ số vào một từ điển lồng nhau (nested dictionary), khiến bộ thăm dò (probe) và hàm gọi lại chương trình học (curriculum callback) chỉ đọc được giá trị không. Sau khi sửa các lỗi, họ triển khai một bộ đánh giá bất đối xứng (asymmetric critic) với vector đặc quyền (privileged vector) lấy từ trình mô phỏng, đồng thời huấn luyện một tác vụ phụ trợ mô hình thế giới (world-model) để dự đoán vector đó — điều này buộc mạng LSTM (Long Short-Term Memory - bộ nhớ dài-ngắn hạn) phải tích hợp động lực học của hệ thống. Mô hình cuối cùng đạt độ tương đồng cosine 50% giữa hướng mũi và hướng mục tiêu thực trong giai đoạn mù (không nhìn thấy mục tiêu), so với -3% của bộ lọc Kalman và 41% của một phi công tự động thuần mạng nơ-ron.
Nguồn: Habr — хаб ИИ —
bản gốc
