Google ने Gemini Robotics 2.0 पेश किया, बेहतर चपलता और सुरक्षा का वादा
Google/DeepMind
Google DeepMind ने Gemini Robotics 2.0 पेश किया है, जो रोबोट नियंत्रण के लिए नए मॉडलों का एक सेट है, जो रोबोटों को अधिक जटिल कार्य करने, बदलते परिवेश का विश्लेषण करने और अन्य रोबोटों के साथ बातचीत करने में सक्षम बनाता है। प्रमुख घटक, Gemini Robotics ER 2, डेवलपर्स के लिए Gemini Live API के माध्यम से उपलब्ध है और पिछले संस्करण की तुलना में वीडियो समझ में महत्वपूर्ण सुधार प्रदर्शित करता है।
Google ने Gemini Robotics 2.0 पेश किया है, जो मॉडलों का एक सेट है जो रोबोटों को अधिक जटिल कार्य करने, बदलते परिवेश का विश्लेषण करने और अन्य रोबोटों के साथ सहयोग करने में सक्षम बनाता है। इसके मूल में embodied reasoning मॉडल है जिसे Gemini Robotics ER 2 कहा जाता है, जो पिछले संस्करण 1.6 की तुलना में एक महत्वपूर्ण सुधार है। यह मॉडल Gemini Live API के साथ एकीकृत है, जिससे डेवलपर्स इसकी क्षमताओं का उपयोग कर सकते हैं। ER 2 एक विज़न लैंग्वेज मॉडल (vision language model, VLM) है, जो रोबोट के कैमरों से लाइव वीडियो स्ट्रीम संसाधित करने में सक्षम है ताकि प्रगति को ट्रैक किया जा सके। Google का दावा है कि ER 2 वीडियो खंडों की पूर्णता को लगभग 60% सटीकता के साथ वर्गीकृत कर सकता है, जो प्रतिस्पर्धी AI मॉडल से बेहतर है। परियोजना का लक्ष्य एक सार्वभौमिक रोबोट बनाना है जो किसी भी मानवीय क्रिया को करने में सक्षम हो, जिसे कभी-कभी 'भौतिक AGI' कहा जाता है।
स्रोत: Ars Technica —
मूल
