данные телеуправления (teleoperation) роботами и данные от первого лица, получаемые от людей, — важнее для универсальных роботов, чем данные из симуляций, поскольку симуляции с трудом воспроизводят подсознательные действия человека. Стратегия Lingbo заключается в разработке нескольких моделей (таких как LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA и LingBot-VA) для решения конкретных технических задач — выравнивания модальностей, предсказания динамики и обеспечения балансировки нагрузки в архитектурах MoE (mixture of experts, смесь экспертов), — вместо того чтобы преждевременно пытаться создать единую комплексную модель, обучаемую по принципу «от начала до конца» (end-to-end). Шэнь ввёл понятие «воплощённо-нативных» (embodied-native) моделей, для которых требуются данные, изначально относящиеся к задачам физического мира, возможности модели, подходящие для взаимодействия в реальном времени, а также способность обучаться «с нуля». В качестве примера он привёл сложности воспроизведения моделей самоконтролируемого обучения зрению, таких как DINO, а также реализации каузального моделирования (causal modeling) с односторонним механизмом внимания. Говоря о безопасности, он подчеркнул, что подход, основанный на «ограждениях» (fence-based safety, то есть ограничении действий), недостаточен, и выступил за «нативную безопасность» (native safety), встроенную ещё на этапе предобучения (pretraining), по аналогии с человеческими инстинктами. Он также предсказал, что «момент ChatGPT» для воплощённого искусственного интеллекта наступит тогда, когда обычные люди смогут легко участвовать в сборе данных, что сделает роботов по-настоящему полезными и позволит им органично войти в повседневную жизнь.