RoboticaModellen 🇨🇳 12.08.2026 06:01

Robotbreinrace gaat de diepte in: waarom de fysieke wereld vraagt om modellen die vanaf nul worden ontworpen

Op de WAIC 2025 stond embodied AI centraal met meer dan 200 bedrijven die exposeerden, waarbij de focus verschoof van performance-robots naar praktische toepassingen zoals handling en inspectie. Shen Yujun, hoofdwetenschapper van Ant Lingbo, stelt dat het aanpassen van videomodellen uit de digitale wereld aan robots via fine-tuning een pad-afhankelijke shortcut is, niet de ultieme oplossing, en pleit voor een 'embodied-native' benadering met modellen die vanaf de grond worden ontworpen voor de fysieke realiteit. Het bedrijf onthulde zijn full-stack Brain 2.0 met zes modellen, waaronder het eerste industrie-brede embodied-native wereld-actie-model, en kondigde een financieringsronde aan die gericht is op het ophalen van 1,5 miljard yuan.
In een interview op de WAIC besprak Shen Yujun, hoofdwetenschapper van Ant Lingbo, de uitdagingen van belichaamde intelligentie. Hij benadrukte dat datastandaarden nog niet zijn geconvergeerd omdat de technische routes nog niet zijn bepaald; er is geen consensus over modaliteiten, precisie of kwaliteit. Hij merkte op dat echte data, vooral teleoperatiedata van robots en eerstpersoonsdata van mensen, belangrijker is dan simulatedata voor algemene robots, omdat simulaties moeite hebben om onbewuste menselijke handelingen te repliceren. De strategie van Lingbo omvat het ontwikkelen van meerdere modellen (zoals LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA en LingBot-VA) om specifieke technische problemen op te lossen, zoals het afstemmen van modaliteiten, het voorspellen van dynamiek en het waarborgen van load balancing in MoE-architecturen, in plaats van te vroeg te proberen één end-to-endmodel te creëren. Shen introduceerde het concept van 'embodied-native' modellen, die data vereisen die inherent zijn aan fysieke wereldtaken, modelcapaciteiten die geschikt zijn voor realtime interactie, en de mogelijkheid om vanaf nul te trainen. Hij wees op moeilijkheden bij het repliceren van self-supervised vision-modellen zoals DINO en het implementeren van causale modellering voor eenrichtingsaandacht. Over veiligheid benadrukte hij dat 'hekgebaseerde' veiligheid (het beperken van acties) onvoldoende is, en pleitte hij voor 'native veiligheid', die tijdens de pretraining wordt ingebed, vergelijkbaar met menselijke instincten. Hij voorspelde ook dat het 'ChatGPT-moment' voor belichaamde AI zal plaatsvinden wanneer gewone mensen gemakkelijk kunnen deelnemen aan gegevensverzameling, waardoor robots echt nuttig worden en geïntegreerd raken in het dagelijks leven.
Bron: InfoQ 中国 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws