ICRA 2026 하이라이트: 강화 학습, 복잡한 행동 생성, 그리고 로보틱스의 미래
Яндекс
Huawei
NVIDIA
OpenDriveLab
Amazon/AWS
Waabi AI
오스트리아 빈에서 열린 2026 국제 로보틱스 및 자동화 학회(International Conference on Robotics and Automation, ICRA)는 주요 트렌드를 선보였습니다: 강화 학습(Reinforcement Learning, RL), 희귀한 엣지 케이스 생성, 그리고 로보틱스에서 머신 러닝(Machine Learning, ML)의 진화. Yandex 자율 주행 팀은 로봇 학습, 인식, 자율 주행 차량에 관한 최우수 논문, 워크숍, 그리고 주목할 만한 연구를 강조합니다.
오스트리아 빈에서 열린 ICRA(International Conference on Robotics and Automation, 국제 로봇공학 및 자동화 학회) 2026에서는 강화학습(Reinforcement Learning), 복잡한 행동 시나리오 생성, 그리고 로보틱스의 미래가 주요 화두로 다뤄졌다. 최우수 학회 논문상(Best Conference Paper Award)은 데이터 효율적인 장기 조작(long-horizon manipulation)을 다룬 SymSkill과 휴머노이드 전신 이동조작(loco-manipulation)을 다룬 OmniRetarget에 돌아갔다.
로봇 학습(Robot Learning) 분야에서는 카메라 조건화를 통한 시점 불변(view-invariant) 정책 학습을 다룬 논문(Do You Know Where Your Camera Is?)이 주목받았다. 이 연구는 VLA(Vision-Language-Action) 모델이 카메라 위치가 바뀌면 성능이 크게 저하된다는 점을 보여주었으며, 픽셀 단위로 플뤼커 좌표(Plücker coordinates)를 이용해 카메라 위치를 인코딩하는 방법을 제안했다. 이 방식은 카메라 무작위화(camera randomization) 없이도 성능을 개선했다.
로봇 인지(Robot Perception) 분야에서는 FindAnything이 여러 파운데이션 모델을 활용해 탐사(exploration)를 수행하는 개방형 어휘(open-vocabulary) 객체 중심 매핑 시스템을 발표했다.
워크숍에서는 Huawei, NVIDIA Research, OpenDriveLab이 공동 개발한 World Engine이 소개되었는데, 이를 통해 자율주행 차량이 상하이에서 개입 없이 200km를 주행했으며 관련 코드도 오픈소스로 공개되었다. NVIDIA는 25개국, 2500개 도시, 1700시간 분량의 주행 데이터를 담은 데이터셋을 활용한 AlpaSim 챌린지를 발표했다.
그 외 주목할 만한 연구로는 행동 복제(behavior cloning) 정책의 미세조정을 위한 Residual Off-Policy RL(Amazon Frontier AI & Robotics), Uni3D 인코더를 활용한 3D 파운데이션 정책 FP3, 계층적 개방형 어휘 3D 분할을 다룬 Search3D, NVIDIA Research의 교차 체화(cross-embodiment) 모빌리티 정책 프레임워크 COMPASS 등이 있었다.
자율주행 분야에서는 Waabi AI가 발표한 Diffusion-guided Generalizable Enhancer가 트랙 인근의 3D 복원 성능을 개선했으며, Attention BEV는 어텐션 블록을 이용해 BEV(Bird's-Eye View, 조감도) 융합을 강화했다. TreeIRL은 몬테카를로 트리 탐색(Monte Carlo Tree Search, MCTS)과 역강화학습(Inverse Reinforcement Learning, IRL)을 결합해 라스베이거스의 안전한 도심 주행을 구현했으며, 지연 및 오탐 AEB(Autonomous Emergency Braking, 자동 긴급제동) 이벤트 주석 시스템은 극심한 클래스 불균형과 레이블 노이즈 문제를 다뤘다. 또 다른 논문은 nuPlan 장면을 활용해 주변 차량을 모방함으로써 주행을 학습하는 방법을 제안했는데, 우수한 에이전트들의 궤적을 자아(ego) 관점으로 변환하는 방식을 사용했다.
출처: Habr — хаб ML —
원문
