Mistral AI stellt Robostral Navigate vor: Ein Modell für Roboternavigation mit einer einzelnen RGB-Kamera
Mistral
Mistral AI präsentiert Robostral Navigate, ein 8B-Parameter-Modell, das Robotern die Navigation in komplexen Umgebungen allein mit einer einzelnen RGB-Kamera ermöglicht. Es erreicht eine Erfolgsquote von 76,6 % bei unbekannten R2R-CE-Benchmarks und übertrifft damit Multi-Sensor-Ansätze bei gleichzeitig höherer Effizienz.
Mistral AI hat Robostral Navigate vorgestellt, sein erstes Modell für verkörperte Navigation. Das 8B-Parameter-Modell verwendet RGB-Bilder und Anweisungen in einfacher Sprache, um einen Roboter durch Umgebungen zu bewegen. Anders als andere Modelle, die Tiefensensoren, LiDAR oder mehrere Kameras nutzen, arbeitet Robostral Navigate mit einer einzigen gewöhnlichen RGB-Kamera und ohne Tiefensensoren und erreicht 76,6 % auf R2R-CE (Room-to-Room in Continuous Environments) bei der Validierung mit unbekannten Daten. Damit übertrifft es den besten Einzelkamera-Ansatz um 9,7 Punkte und das beste System mit Tiefensensoren oder mehreren Kameras um 4,5 Punkte. Das Modell wurde vollständig intern mit simulierten Daten und tokeneffizienten Techniken entwickelt und funktioniert bei Rad-, Bein- und Flugrobotern. Es verwendet eine zeigebasierte Navigationsmethode, die Bildkoordinaten von Zielorten vorhersagt und bei nicht sichtbaren Zielen auf Verschiebungen im lokalen Koordinatenrahmen zurückgreift. Die Trainingseffizienz wird durch Präfix-Caching erreicht, das die Trainings-Token um das 22-Fache reduziert; Online-Verstärkungslernen mit CISPO verbessert die Erfolgsrate zusätzlich um 3,2 %.
Quelle: Mistral AI —
Original
