물리적 AI: 로봇이 스크립트된 동작을 넘어서는 방법
물리적 AI 분야는 로봇에게 진정한 인식과 의사 결정 능력을 부여하여 스크립트된 데모를 넘어서는 것을 목표로 합니다. 주요 트렌드로는 단일 종단 간(end-to-end) 두뇌 대신 에이전트 기반 아키텍처, 새로운 학습 방법, 그리고 시각, 언어, 촉각 감지에 대한 집중이 포함됩니다. 궁극적인 목표는 실제 생산 환경에서 로봇을 유용하게 만드는 것입니다.
물리적 AI(Physical AI)란 로봇이 물리적 세계를 인식하고 이해하며 행동할 수 있게 해주는 지능형 소프트웨어를 의미하며, 인간형 형태와는 구별된다. 인간형 로봇은 종종 인상적인 스크립트 시연을 선보이지만 변화하는 조건에 적응하는 능력이 부족하다. 업계는 단일 대규모 엔드투엔드 모델을 학습시키는 방식에서 에이전트 기반 접근 방식으로 전환하고 있으며, 이 방식에서는 여러 특화 모델이 다양한 양식(비전, 언어, 행동)을 처리하고 개별적으로 업데이트할 수 있다. 학습은 여전히 병목 지점으로 남아 있다. 대규모 언어 모델(LLM)에 사용되는 것과 같은 대규모 데이터 세트가 없으며, 비디오에서 학습하는 방법과 같은 기법도 추가적인 주석이 필요하다. 비전은 가장 성숙한 감각 채널로, 비전-언어-행동(VLA) 모델은 사전 학습된 비전 인코더를 활용하고 이미지를 텍스트처럼 토큰화한다. 언어는 범용 인터페이스 역할을 하여 높은 수준의 명령을 상위 수준 플래너가 분해할 수 있게 한다. 촉각 감지는 정밀한 조작이 필요한 작업에 중요하다고 간주되며, 물체를 잡은 후에는 비전만으로는 부족하기 때문이다. 연구는 인공 피부를 탐구하지만, 현재 로봇은 힘 센서를 사용한다. 고유 수용 감각(Proprioception) 즉, 로봇 자신의 신체 상태를 아는 것도 또 다른 필수 채널로, 인코더, 관성 측정 장치(IMU), 토크 센서를 사용한다. 인간과 같은 손재주와 적응력을 달성하는 것은 여전히 먼 목표이지만, 에이전트형 아키텍처와 점진적인 개선이 실질적인 진전의 경로로 간주된다.
출처: Habr — хаб ML —
원문
