Gemini Robotics ER 2: videon ymmärryksellä, tehtävien orkestroinnilla ja monirobottiyhteistyöllä varustettu robottiteknologia
Google/DeepMind
Boston Dynamics
Google DeepMind on julkaissut Gemini Robotics ER 2:n, uuden kehollisen päättelyn mallin robotiikkaan. Se mahdollistaa reaaliaikaisen videon ymmärryksen, monivaiheisen tehtävien suunnittelun ja monirobottiyhteistyön, ja on saatavilla Gemini API:n ja Google AI Studion kautta.
Google DeepMind esitteli Gemini Robotics ER 2:n, ruumiillistuneen päättelymallin robotiikkaan, joka toimii robottien korkean tason aivoina. Se pystyy keskustelemaan ihmisten kanssa, ymmärtämään fyysistä maailmaa, suunnittelemaan monivaiheisia tehtäviä ja siirtämään motorisen suorituksen alemman tason visio-kieli-toimintamalleille (VLA-malleille). Malli kutsuu natiivisti työkaluja, kuten Google Searchia tai käyttäjän määrittelemiä funktioita. Se on parannus ER 1.6:een verrattuna, sillä se käsittelee jatkuvia videovirtoja seuratakseen edistymistä, sopeutuakseen virhetilanteisiin ja määrittääkseen tehtävän valmistumisen. Monirobottiyhteistyö otetaan käyttöön, mikä mahdollistaa erilaisten robottien työskentelyn yhdessä. Gemini Robotics ER 2 saavuttaa 57,4 prosentin tarkkuuden edistymisen luokittelussa ja 91,3 prosentin tarkkuuden hetkenetsintätehtävissä alle sekunnin vasteajalla. Se ylittää aiemmat mallit turvallisuusvertailuarvoissa, mukaan lukien humanoidirobotin pysäyttämisen, kun henkilö on lähellä. Malli on julkisesti saatavilla Gemini API:n, Google AI Studion kautta ja yksityisessä esikatselussa Gemini Enterprise Agent Platformilla.
Lähde: Google DeepMind —
Alkuperäinen
