OmniRetarget — за whole-body loco-manipulation (манипуляции всем телом при передвижении) гуманоидных роботов. В секции Robot Learning доклад о view-invariant (инвариантном к точке обзора) обучении политик с кондиционированием на камеру («Do You Know Where Your Camera Is?») показал, что модели VLA (Vision-Language-Action, «зрение-язык-действие») заметно теряют качество при перемещении камер, и предложил кодировать положение камеры с помощью координат Плюккера для каждого пикселя, что улучшает результаты даже без рандомизации положения камеры. В секции Robot Perception была представлена система FindAnything — open-vocabulary (с открытым словарём) object-centric (объектно-ориентированное) картирование, использующее несколько фундаментальных моделей для исследования пространства. На воркшопах проект World Engine от Huawei, NVIDIA Research и OpenDriveLab позволил беспилотному автомобилю проехать 200 км по Шанхаю без единого вмешательства человека, а код проекта был опубликован в открытом доступе. NVIDIA анонсировала соревнование AlpaSim с набором данных, собранным в 25 странах, 2500 городах и включающим 1700 часов вождения. Среди других заметных работ — Residual Off-Policy RL для доработки политик, полученных через behavior cloning (клонирование поведения), от команды Amazon Frontier AI & Robotics; FP3 (3D Foundation Policy на основе энкодера Uni3D); Search3D — иерархическая система open-vocabulary 3D-сегментации; и COMPASS — cross-embodiment (работающий с разными типами роботов) фреймворк политик мобильности от NVIDIA Research.

Показать ещё ↓