миллиардов тактильных изображений, собранных с 6 роботизированных платформ (Franka, Piper, UR5e и др.), охватывающих 450 долгосрочных задач, выполняемых 90 операторами. N0-VTLA представляет собой тактильно-улучшенную модель Vision-Language-Action (VLA), которая предсказывает будущие тактильные состояния на 50 шагов вперед, достигая 85% успеха при вставке штекера (по сравнению с 60% для модели только с визуальным восприятием) и 99% при извлечении ключа (по сравнению с 35%). N0-TWAM — это модель мира с 7,2 миллиарда параметров, использующая архитектуру смеси экспертов и одновременно предсказывающая видео, тактильные данные и последовательности действий; средний показатель успеха в симуляции составляет 84,5% (базовый уровень 36%), в реальном мире — 46,3% (LingBot-VA — 21,9%). Проект опубликован в открытом доступе на сайте research.neoteai.com.