Создатели Riemann-1.0 научили робота убираться, показав 200 000 часов видео с людьми
Китайская компания Riemann Dynamics представила модель Riemann-1.0 для роботов, которая заняла первое место в бенчмарке RoboCasa-365 с результатом 62,6%, превзойдя предыдущий SOTA на 8,4%. Модель обучалась на 232 000 часов видео, из которых 200 000 часов — видео с людьми, выполняющими бытовые задачи, что позволило роботу научиться понимать физический мир и выполнять сложные последовательные действия.
Компания Riemann Dynamics (дочерняя компания Kunlun Tech) официально представила модель Riemann-1.0, которая сразу же заняла первое место в бенчмарке RoboCasa-365 с результатом 62,6%, что на 8,4% выше предыдущего SOTA. Это достижение примечательно тем, что большинство участников бенчмарка не достигают 50%. Модель обучалась на 232 000 часов данных, из которых основную часть (более 200 000 часов) составляют видеозаписи повседневных действий человека от первого лица: приготовление еды, складывание одежды, уборка со стола. Такой подход стал возможен после того, как в индустрии робототехники оформился консенсус: будущие фундаментальные модели для роботов должны сочетать Vision-Language-Action (VLA) и World Model, используя для обучения большие объёмы неразмеченных «диких» видео. Riemann-1.0 решает ключевую проблему — как преобразовать видео человека, где нет меток действий робота, в управляющие сигналы для робота. Для этого компания разработала автоматический пайплайн обработки человеческих данных, который включает коррекцию искажений, семантическую нарезку с помощью VLM, фильтрацию некачественных фрагментов, реконструкцию 3D-позы руки и преобразование траекторий движения в мировые координаты. Архитектура модели основана на диффузии и использует полностью каузальную совместную модель действия и видео, что позволяет одновременно предсказывать динамику мира и действия робота. Для адаптации к 41 различному типу роботов введены модули отображения действий. Обучение проходит в три этапа с поэтапным увеличением веса потерь на действия: 0.1 (предобучение на человеческих видео с извлечением латентных действий), 0.5 (калибровка на UMI и реальных данных робота), 0.9 (финальная донастройка только на робо-данных). Абляционные эксперименты показали: добавление человеческих видео повышает успешность с 48,2% до 62,6% — прирост на 14,4 процентных пункта. На тестах с реальным роботом (уборка стола, складывание ткани, укладка кубиков) средняя успешность составила 85,00%, а полнота процесса — 94,43%, что значительно превосходит открытые базовые модели. Компания Riemann Dynamics была основана Kunlun Tech как отдельное юридическое лицо для разработки технологий воплощённого интеллекта, используя вычислительные ресурсы и экосистему материнской компании.
- Сокращения
- VLM = Vision-Language Model — модель зрения и языка
- SOTA = State of the Art — передовой уровень
- VLA = Vision-Language-Action — зрение-язык-действие
- UMI = Universal Manipulation Interface — универсальный интерфейс манипуляции
Источник: QbitAI 量子位 —
оригинал
