без датчиков глубины, достигая 76,6% точности на R2R-CE (комнаты в непрерывной среде) при проверке на незнакомых данных. Это превосходит лучший однокамерный подход на 9,7 процентных пункта, а лучшую систему с глубиной или несколькими камерами — на 4,5 пункта. Модель полностью разработана внутри компании с использованием симулированных данных и эффективных методов токенизации, и она обобщается на колёсных, ногастых и летающих роботов. Она использует метод навигации на основе указания, который предсказывает координаты целевых местоположений на изображении, переходя к локальным смещениям в системе координат, когда цели находятся вне поля зрения. Эффективность обучения достигается за счёт префиксного кеширования, сокращая объём обучающих токенов в 22 раза; онлайн-обучение с подкреплением с помощью CISPO дополнительно повышает показатель успешности на 3,2%.