Gemini Robotics ER 2: robotica aangedreven door videobegrip, taakorkestratie en multi-robot samenwerking
Google/DeepMind
Boston Dynamics
Google DeepMind heeft Gemini Robotics ER 2 gelanceerd, een nieuw belichaamd redeneermodel voor robotica. Het maakt real-time videobegrip, meerstaps taakplanning en samenwerking tussen meerdere robots mogelijk, en is beschikbaar via de Gemini API en Google AI Studio.
Google DeepMind introduceert Gemini Robotics ER 2, een embodied reasoning-model voor robotica dat fungeert als een hoogwaardig brein voor robots. Het kan met mensen chatten, de fysieke wereld begrijpen, meerstapstaken plannen en de motoruitvoering overdragen aan vision-language-action-modellen (VLA-modellen) op een lager niveau. Het model roept native tools aan zoals Google Zoeken of door de gebruiker gedefinieerde functies. Het verbetert ten opzichte van ER 1.6 door continue videostreams te verwerken om de voortgang bij te houden, zich aan te passen aan mislukkingen en te bepalen of een taak is voltooid. Multi-robot-samenwerking wordt geïntroduceerd, waardoor diverse robots kunnen samenwerken. Gemini Robotics ER 2 behaalt 57,4% nauwkeurigheid bij voortgangsclassificatie en 91,3% nauwkeurigheid bij moment-finding-taken met een latentie van minder dan een seconde. Het presteert beter dan eerdere modellen op veiligheidsbenchmarks, waaronder het stoppen van een humanoïde robot wanneer een persoon in de buurt is. Het model is openbaar beschikbaar via de Gemini API, Google AI Studio en in privépreview op het Gemini Enterprise Agent Platform.
Bron: Google DeepMind —
origineel
