огромной сквозной модели к подходу на основе агентов, где несколько специализированных моделей обрабатывают различные модальности (зрение, язык, действия) и могут обновляться независимо. Обучение остается узким местом: нет крупномасштабных наборов данных, подобных тем, что используются для больших языковых моделей, а такие методы, как обучение на видео, все еще требуют дополнительных аннотаций. Зрение является наиболее зрелым сенсорным каналом, при этом модели «зрение-язык-действие» (Vision-Language-Action, VLA) используют предварительно обученные зрительные кодировщики и токенизируют изображения, как текст. Язык выступает в качестве универсального интерфейса, позволяя планировщикам высокого уровня разбивать команды высокого уровня. Тактильное восприятие считается критически важным для задач, требующих точных манипуляций, поскольку зрение недостаточно, когда объект уже захвачен; исследования изучают искусственную кожу, но современные роботы используют датчики силы. Проприоцепция — знание собственного состояния тела робота — является еще одним важным каналом, использующим энкодеры, инерциальные измерительные блоки (IMU) и датчики крутящего момента. Достижение человекоподобной ловкости и адаптивности остается отдаленной целью, но агентные архитектуры и постепенные улучшения рассматриваются как практический путь вперед.