Corrida do Cérebro de Robôs Entra em Águas Profundas: Por Que o Mundo Físico Exige Modelos Projetados do Zero
Na WAIC 2025, a IA incorporada ocupou o centro do palco com mais de 200 empresas expondo, mudando o foco de robôs de desempenho para aplicações práticas, como manuseio e inspeção. O cientista-chefe da Ant Lingbo, Shen Yujun, argumenta que adaptar modelos de vídeo do mundo digital para robôs por meio de ajuste fino é um atalho dependente de caminho, não uma solução definitiva, defendendo uma abordagem 'nativa-incorporada' com modelos projetados desde o início para a realidade física. A empresa apresentou seu Brain 2.0 de pilha completa com seis modelos, incluindo o primeiro modelo de ação-mundial nativo-incorporado da indústria, e anunciou uma rodada de financiamento visando arrecadar 1,5 bilhão de yuans.
Em uma entrevista na WAIC, o cientista-chefe da Ant Lingbo, Shen Yujun, discutiu os desafios da inteligência incorporada, enfatizando que os padrões de dados não convergiram porque as rotas técnicas ainda não foram decididas, sem consenso sobre modalidades, precisão ou qualidade. Ele observou que dados reais, especialmente dados de teleoperação de robôs e dados em primeira pessoa de humanos, são mais críticos do que dados de simulação para robôs de propósito geral, pois as simulações têm dificuldade em replicar ações subconscientes humanas. A estratégia da Lingbo envolve o desenvolvimento de múltiplos modelos (como LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA e LingBot-VA) para resolver problemas técnicos específicos, como alinhar modalidades, prever dinâmicas e garantir balanceamento de carga em arquiteturas MoE (mistura de especialistas), em vez de tentar um único modelo de ponta a ponta prematuramente. Shen introduziu o conceito de modelos 'nativos incorporados', que exigem dados nativos de tarefas do mundo físico, capacidades de modelo adequadas para interação em tempo real e a capacidade de treinar do zero, citando dificuldades em replicar modelos de visão autossupervisionados como o DINO e implementar modelagem causal para atenção unidirecional. Sobre segurança, ele enfatizou que a segurança baseada em 'cercas' (restringindo ações) é insuficiente, defendendo a 'segurança nativa' incorporada durante o pré-treinamento, semelhante aos instintos humanos. Ele também previu que o 'momento ChatGPT' para IA incorporada ocorrerá quando pessoas comuns puderem participar facilmente da coleta de dados, tornando os robôs verdadeiramente benéficos e integrados à vida diária.
Fonte: InfoQ 中国 —
original
