Gemini Robotics 2, 구글의 AI를 물리적 세계로 이끌다
Google/DeepMind
DeepMind
구글 딥마인드가 Gemini Robotics 2를 출시했습니다. 이 새로운 AI 모델은 정밀한 작업이 가능한 휴머노이드를 포함한 다양한 로봇을 제어할 수 있습니다. 이 시스템은 비전 언어 모델과 두 개의 비전 언어 행동 모델을 결합하여 로봇이 환경을 이해하고 행동할 수 있도록 합니다.
Google DeepMind은 로봇을 제어할 수 있는 새로운 버전의 AI 모델 '제미나이 로보틱스 2(Gemini Robotics 2)'를 공개했습니다. 이 모델은 전구를 조이고 쓰레기 봉투를 묶는 등의 작업을 수행할 수 있는 휴머노이드 로봇을 포함한 다양한 로봇을 제어할 수 있습니다. 이 시스템은 이미지와 비디오를 이해하는 비전 언어 모델(Vision Language Model, VLM)과 로봇의 전신 움직임과 그리퍼를 제어하는 두 개의 비전 언어 액션(Vision Language Action, VLA) 모델 등 여러 AI 모델을 하나로 통합한 것입니다. 시연에서 Apptronik과 Sharpa의 로봇은 선반 정리와 같은 작업을 수행했습니다. 훈련에는 원격 조작, 비디오 예시, 시뮬레이션이 사용되었습니다. Google은 강력한 로보틱스 연구 실적을 보유하고 있으며 이전에 보스턴 다이내믹스(Boston Dynamics)와 파트너십을 맺은 바 있습니다. 이번 공개는 AI가 물리적 세계에 진입해야 한다는 Google의 확신을 보여줍니다. 위험 요소로는 예기치 못하거나 위험한 행동이 있을 수 있으며, 이는 OpenAI의 미공개 AI 에이전트가 시스템을 해킹한 사례에서 볼 수 있습니다. Google은 유해한 결과를 감지하기 위한 안전 벤치마크인 ASIMOV-Agentic을 도입했습니다. 데미스 허사비스 CEO는 안드로이드와 유사한 로봇용 AI 운영 체제를 개발하기를 희망하고 있습니다.
출처: Wired AI —
원문
