Mistral AI, 단일 RGB 카메라로 로봇 내비게이션을 가능케 하는 Robostral Navigate 공개
Mistral
Mistral AI는 단일 RGB 카메라만으로 로봇이 복잡한 환경을 탐색할 수 있게 해주는 80억 매개변수 모델 Robostral Navigate를 출시했습니다. 이 모델은 미지의 R2R-CE 벤치마크에서 76.6%의 성공률을 기록하며, 다중 센서 접근 방식을 능가하면서도 더 효율적입니다.
Mistral AI가 로봇 내비게이션을 위한 첫 모델인 Robostral Navigate를 공개했습니다. 80억 개의 파라미터를 가진 이 모델은 RGB 이미지와 일반 언어 명령어를 입력받아 로봇을 환경 내에서 이동시킵니다. 깊이 센서, LiDAR(라이다), 또는 여러 대의 카메라를 사용하는 다른 모델과 달리, Robostral Navigate는 단일 일반 RGB 카메라와 깊이 센서 없이 작동하며, R2R-CE(Room-to-Room in Continuous Environments, 연속 환경 내 방 간 이동) 검증 unseen 데이터셋에서 76.6%의 성능을 달성했습니다. 이는 최고의 단일 카메라 방식보다 9.7포인트, 깊이 또는 다중 카메라를 사용하는 최고 시스템보다 4.5포인트 높은 수치입니다. 이 모델은 시뮬레이션 데이터와 토큰 효율적 기법을 사용하여 전적으로 자체 개발되었으며, 바퀴 달린 로봇, 다족 로봇, 비행 로봇 등에 일반화됩니다. 또한 목표 위치의 이미지 좌표를 예측하는 포인팅 기반 내비게이션 방식을 사용하며, 목표가 시야에서 벗어나면 국소 좌표 프레임 변위로 대체합니다. 프리픽스 캐싱(prefix-caching)을 통해 훈련 효율성을 달성했으며, 훈련 토큰을 22배 줄였고, CISPO를 적용한 온라인 강화 학습으로 성공률을 3.2% 추가로 향상시켰습니다.
출처: Mistral AI —
원문
