Gemini Robotics ER 2: वीडियो समझ, कार्य ऑर्केस्ट्रेशन और मल्टी-रोबोट सहयोग के साथ रोबोटिक्स को सशक्त बनाना
Google/DeepMind
Boston Dynamics
Google DeepMind ने Gemini Robotics ER 2 लॉन्च किया है, जो रोबोटिक्स के लिए एक नया एम्बॉडिड रीज़निंग मॉडल है। यह रियल-टाइम वीडियो समझ, मल्टी-स्टेप कार्य योजना और मल्टी-रोबोट सहयोग को सक्षम बनाता है, और Gemini API तथा Google AI Studio के माध्यम से उपलब्ध है।
Google DeepMind ने जेमिनी रोबोटिक्स ईआर 2 पेश किया, जो रोबोटिक्स के लिए एक सन्निहित तर्क मॉडल है और रोबोट के लिए उच्च-स्तरीय मस्तिष्क के रूप में कार्य करता है। यह मनुष्यों के साथ बातचीत कर सकता है, भौतिक दुनिया को समझ सकता है, बहु-चरणीय कार्यों की योजना बना सकता है, और मोटर निष्पादन को निचले-स्तरीय दृष्टि-भाषा-क्रिया (वीएलए) मॉडल को सौंप सकता है। यह मॉडल मूल रूप से गूगल सर्च या उपयोगकर्ता-परिभाषित फ़ंक्शन जैसे उपकरणों को कॉल करता है। यह ईआर 1.6 से बेहतर है, क्योंकि यह प्रगति को ट्रैक करने, विफलताओं के अनुकूल होने और कार्य पूर्णता निर्धारित करने के लिए निरंतर वीडियो फीड प्रोसेस करता है। बहु-रोबोट सहयोग शुरू किया गया है, जिससे विभिन्न रोबोट एक साथ काम कर सकते हैं। जेमिनी रोबोटिक्स ईआर 2 प्रगति वर्गीकरण पर 57.4% सटीकता और क्षण-खोज कार्यों पर 91.3% सटीकता प्राप्त करता है, जिसमें उप-सेकंड विलंबता है। यह सुरक्षा बेंचमार्क पर पिछले मॉडलों से बेहतर प्रदर्शन करता है, जिसमें एक मानवीय रोबोट को रोकना शामिल है जब कोई व्यक्ति पास में होता है। यह मॉडल जेमिनी एपीआई, गूगल एआई स्टूडियो और जेमिनी एंटरप्राइज एजेंट प्लेटफॉर्म पर निजी प्रीव्यू में सार्वजनिक रूप से उपलब्ध है।
स्रोत: Google DeepMind —
मूल
