РоботикаИсследования 🇺🇸 20.07.2026 13:06

ByteDance представила Astra: двухмодельную архитектуру для автономной навигации роботов

ByteDanceByteDance
ByteDance разработала Astra — инновационную архитектуру с двумя моделями (Astra-Global и Astra-Local), решающую задачи глобальной и локальной навигации мобильных роботов в сложных indoor-средах. Архитектура основана на парадигме System 1/System 2 и использует мультимодальные большие языковые модели, гибридные тополого-семантические графы и 4D-пространственно-временное кодирование. Эксперименты показали 99,9% точности локализации в незнакомых домашних средах и существенное снижение числа коллизий.
ByteDance представила Astra — двухмодульную архитектуру для автономной навигации мобильных роботов, состоящую из Astra-Global и Astra-Local. Astra-Global, работающая как мультимодальная большая языковая модель, отвечает за низкочастотные задачи глобальной локализации: самоопределение положения робота и определение целевого местоположения на основе текстовых или визуальных запросов. Для этого используется гибридный тополого-семантический граф, построенный на основе офлайн-картографирования. Обучение велось методом supervised fine-tuning с использованием группы относительной политики оптимизации на базе Qwen2.5-VL, что обеспечило 99,9% точности в незнакомых домашних средах. Astra-Local занимается высокочастотными задачами локального планирования траектории и оценки одометрии. Её 4D-пространственно-временной энкордер обрабатывает изображения от нескольких камер и предсказывает будущие воксельные признаки, а планировщик на основе трансформеров и маскированной ESDF-функции потерь генерирует безопасные траектории. Оценка одометрии объединяет данные с IMU и колёсных датчиков для повышения точности. Эксперименты в складах, офисах и домах подтвердили превосходство Astra над традиционными методами визуального распознавания мест и другими подходами к планированию, особенно на данных вне распределения.
Сокращения
MLLM = Multimodal Large Language Model — мультимодальная большая языковая модель
SFT = Supervised Fine-Tuning — контролируемая тонкая настройка
GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
ESDF = Euclidean Signed Distance Field — поле знаковых расстояний Евклида
OOD = out-of-distribution — вне распределения
VPR = Visual Place Recognition — визуальное распознавание мест
ViT = Vision Transformer — трансформер для изображений
IMU = Inertial Measurement Unit — инерциальный измерительный блок
6-DoF = 6 Degrees of Freedom — 6 степеней свободы
Источник: Synced — оригинал

Наши прошлые публикации по теме

Есть свежие новости