RobóticaModelos 🇨🇳 12.08.2026 06:01

La carrera por el cerebro robótico entra en aguas profundas: por qué el mundo físico exige diseñar modelos desde cero

En el WAIC 2025, la IA corpórea ocupó un lugar central con más de 200 empresas participantes, desplazando el enfoque desde robots de rendimiento hacia aplicaciones prácticas como manipulación e inspección. El científico jefe de Ant Lingbo, Shen Yujun, argumenta que adaptar los modelos de video del mundo digital a los robots mediante el ajuste fino es un atajo dependiente del camino, no una solución definitiva, y aboga por un enfoque 'nativo-corpóreo' con modelos diseñados desde cero para la realidad física. La empresa presentó su Brain 2.0 de pila completa con seis modelos, incluido el primer modelo de acción-mundo nativo-corpóreo de la industria, y anunció una ronda de financiación que pretende recaudar 1.500 millones de yuanes.
En una entrevista en la WAIC, el científico principal de Ant Lingbo, Shen Yujun, abordó los desafíos de la inteligencia encarnada, enfatizando que los estándares de datos no han convergido porque las rutas técnicas aún no están decididas, sin consenso sobre modalidades, precisión o calidad. Señaló que los datos reales, especialmente los datos de teleoperación de robots y los datos en primera persona de los humanos, son más críticos que los datos simulados para robots de propósito general, ya que las simulaciones tienen dificultades para replicar las acciones subconscientes humanas. La estrategia de Lingbo implica desarrollar múltiples modelos (como LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA y LingBot-VA) para resolver problemas técnicos específicos, como alinear modalidades, predecir dinámicas y asegurar el equilibrio de carga en arquitecturas MoE, en lugar de intentar un modelo único de extremo a extremo prematuramente. Shen introdujo el concepto de modelos 'nativos encarnados', que requieren datos nativos de tareas del mundo físico, capacidades de modelo adecuadas para la interacción en tiempo real y la capacidad de entrenar desde cero, citando dificultades para replicar modelos de visión autosupervisados como DINO e implementar modelado causal para atención unidireccional. En cuanto a la seguridad, enfatizó que la seguridad 'basada en cercas' (restringir acciones) es insuficiente, abogando por una 'seguridad nativa' incorporada durante el preentrenamiento, similar a los instintos humanos. También predijo que el 'momento ChatGPT' para la IA encarnada ocurrirá cuando la gente común pueda participar fácilmente en la recopilación de datos, haciendo que los robots sean realmente beneficiosos e integrados en la vida diaria.
Fuente: InfoQ 中国 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas