RobotikModelle 🇨🇳 12.08.2026 06:01

Roboter-Gehirn-Wettlauf erreicht tiefe Gewässer: Warum die physische Welt das Design von Modellen von Grund auf erfordert

Auf der WAIC 2025 stand die verkörperte KI im Mittelpunkt, mit über 200 ausstellenden Unternehmen, die den Fokus von Performance-Robotern auf praktische Anwendungen wie Handhabung und Inspektion verlagerten. Der leitende Wissenschaftler von Ant Lingbo, Shen Yujun, argumentiert, dass die Anpassung von Videomodellen der digitalen Welt an Roboter durch Feintuning ein pfadabhängiger Abkürzungsweg ist, aber keine endgültige Lösung, und befürwortet einen 'verkörperten-nativen' Ansatz mit Modellen, die von Grund auf für die physische Realität entwickelt werden. Das Unternehmen stellte sein Full-Stack Brain 2.0 mit sechs Modellen vor, einschließlich des branchenweit ersten verkörperten-nativen Weltaktionsmodells, und kündigte eine Finanzierungsrunde an, die 1,5 Milliarden Yuan einbringen soll.
In einem Interview auf der WAIC erörterte Shen Yujun, Chefwissenschaftler von Ant Lingbo, die Herausforderungen der verkörperten Intelligenz und betonte, dass die Datenstandards noch nicht konvergiert sind, da die technischen Wege noch unentschieden sind, ohne Konsens über Modalitäten, Präzision oder Qualität. Er merkte an, dass echte Daten, insbesondere Teleoperationsdaten von Robotern und Ich-Perspektiven-Daten von Menschen, für Allzweckroboter wichtiger sind als Simulationsdaten, da Simulationen Schwierigkeiten haben, unbewusste Handlungen des Menschen zu replizieren. LINGBOS Strategie besteht darin, mehrere Modelle (wie LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA und LingBot-VA) zu entwickeln, um spezifische technische Probleme zu lösen, wie die Angleichung von Modalitäten, die Vorhersage von Dynamiken und die Sicherstellung von Lastenausgleich in Mixture-of-Experts-Architekturen, anstatt vorzeitig ein einzelnes End-to-End-Modell zu versuchen. Shen führte das Konzept der 'verkörperungsnativen' Modelle ein, die Daten erfordern, die für Aufgaben der physischen Welt natürlich sind, Modellfähigkeiten, die für Echtzeitinteraktion geeignet sind, und die Fähigkeit, von Grund auf zu trainieren. Er verwies auf Schwierigkeiten, selbstüberwachte Vision-Modelle wie DINO zu replizieren und kausale Modellierung für einseitige Aufmerksamkeit zu implementieren. In Bezug auf Sicherheit betonte er, dass 'zaunbasierte' Sicherheit (Einschränkung von Aktionen) unzureichend ist, und plädierte für 'native Sicherheit', die während des Vortrainings eingebettet ist, ähnlich wie menschliche Instinkte. Er prognostizierte auch, dass der 'ChatGPT-Moment' für verkörperte KI eintreten wird, wenn gewöhnliche Menschen leicht an der Datensammlung teilnehmen können, wodurch Roboter wirklich nützlich und in den Alltag integriert werden.
Quelle: InfoQ 中国 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten