Gemini Robotics 2 tuo koko kehon älykkyyden roboteille
Google/DeepMind
DeepMind
Google DeepMind esittelee Gemini Robotics 2:n, joukon tekoälymalleja, jotka mahdollistavat koko kehon hallinnan, ketteryyden ja monirobotiikan yhteistyön mukautuville roboteille. Mallit sisältävät näkö-kieli-toimintamallin (VLA, vision-language-action model), ruumiillistuneen päättelymallin (ER, embodied reasoning model) ja laitteella toimivan VLA:n, jotka tukevat tehtäviä humanoidikävelystä herkkään käsittelyyn.
Google DeepMind julkisti Gemini Robotics 2:n, uuden älykkyystason roboteille, joka mahdollistaa koko kehon hallinnan, hienomotoriset taidot ja monirobotiikan yhteistyön. Järjestelmä sisältää kolme mallia: Gemini Robotics 2, joka on visio-kieli-toimintamalli (vision-language-action, VLA) moottorin ohjaukseen; Gemini Robotics ER 2, kehollinen päättelymalli suunnitteluun ja viestintään; sekä Gemini Robotics On-Device 2, tehokas VLA-malli, joka on optimoitu paikalliseen suoritukseen. Nämä mallit voivat ohjata ihmisenkaltaisia robotteja, kuten Apptronikin Apollo 2:ta, jaloista sormenpäihin, suorittaa herkkiä tehtäviä, kuten solmujen sitomista viisisormisella kädellä, ja mahdollistaa monirobotiikan tiimityön. ER-malli on saatavilla Google AI Studiossa ja yksityisessä esiversiossa Gemini Enterprise Agent -alustalla, kun taas VLA-malli ja laitteella toimivat mallit ovat tarkoitettu varhaisen vaiheen kumppaneille. Turvatoimiin kuuluu ASIMOV-Agentic-vertailu, joka varmistaa turvalliset työkalujen kutsut ja ihmisten läheisyyden havaitsemisen. Tämä työ on virstanpylväs kohti yleiskäyttöistä fyysistä tekoälyä.
Lähde: Google DeepMind —
Alkuperäinen
