Google esittelee Gemini Robotics 2.0:n ja lupaa parempaa ketteryyttä ja turvallisuutta
Google/DeepMind
Google DeepMind esitteli Gemini Robotics 2.0:n, uuden robottien ohjaukseen tarkoitetun mallisarjan, jonka avulla robotit voivat suorittaa monimutkaisempia tehtäviä, analysoida muuttuvaa ympäristöä ja olla vuorovaikutuksessa muiden robottien kanssa. Keskeinen osa, Gemini Robotics ER 2, on kehittäjien saatavilla Gemini Live -sovellusliittymän (API) kautta ja osoittaa merkittävää parannusta videon ymmärtämisessä edelliseen versioon verrattuna.
Google on julkistanut Gemini Robotics 2.0:n, mallikokoelman, jonka avulla robotit voivat suorittaa monimutkaisempia tehtäviä, analysoida muuttuvaa ympäristöä ja tehdä yhteistyötä muiden robottien kanssa. Pohjalla on embodied reasoning -malli nimeltä Gemini Robotics ER 2, joka on merkittävä parannus edelliseen versioon 1.6 verrattuna. Tämä malli on integroitu Gemini Live -rajapintaan, mikä mahdollistaa kehittäjille sen ominaisuuksien hyödyntämisen. ER 2 on vision language model (VLM), joka pystyy käsittelemään reaaliaikaisia videovirtoja robotin kameroista seuratakseen edistymistä. Google väittää, että ER 2 pystyy luokittelemaan videopätkien täydellisyyden lähes 60 prosentin tarkkuudella, mikä on parempi kuin kilpailevilla tekoälymalleilla. Projektin tavoitteena on luoda yleiskäyttöinen robotti, joka pystyy suorittamaan mitä tahansa ihmisen toimintoja, jota kutsutaan joskus 'fyysiseksi AGI:ksi'.
Lähde: Ars Technica —
Alkuperäinen
