Gemini Robotics ER 2: 비디오 이해, 작업 오케스트레이션 및 다중 로봇 협업을 통한 로보틱스 강화
Google/DeepMind
Boston Dynamics
Google DeepMind가 새로운 로보틱스용 임베디드 추론 모델인 Gemini Robotics ER 2를 출시했습니다. 이 모델은 실시간 비디오 이해, 다단계 작업 계획 및 다중 로봇 협업을 가능하게 하며, Gemini API와 Google AI Studio를 통해 사용할 수 있습니다.
Google DeepMind이 로봇을 위한 고수준 두뇌 역할을 하는 내재적 추론 모델 Gemini Robotics ER 2를 공개했습니다. 이 모델은 인간과 대화하고, 물리적 세계를 이해하며, 다단계 작업을 계획하고, 모터 실행을 하위 수준의 시각-언어-행동(VLA) 모델에 넘길 수 있습니다. 또한 Google 검색이나 사용자 정의 함수 같은 도구를 기본적으로 호출합니다. ER 1.6보다 개선된 점은 연속 비디오 피드를 처리하여 진행 상황을 추적하고, 실패에 적응하며, 작업 완료 여부를 판단한다는 것입니다. 다중 로봇 협업 기능이 도입되어 다양한 로봇이 함께 작업할 수 있습니다. Gemini Robotics ER 2는 진행 분류 정확도 57.4%, 순간 찾기 작업 정확도 91.3%를 밀리초 미만의 지연 시간으로 달성합니다. 사람이 근처에 있을 때 인간형 로봇을 정지시키는 등 안전 벤치마크에서 이전 모델보다 뛰어난 성능을 보입니다. 이 모델은 Gemini API, Google AI Studio를 통해 공개적으로 사용 가능하며, Gemini Enterprise Agent Platform에서 비공개 프리뷰로 제공됩니다.
출처: Google DeepMind —
원문
