Dyna Robotics, 인간 비디오 100만 시간으로 사전 학습한 World-Action 모델 Dyna-2 공개
Dyna Robotics가 로봇 조작을 위한 World-Action 모델 Dyna-2를 공개했습니다. 이 모델은 100만 시간 이상의 자아중심 인간 비디오로 사전 학습되었습니다. 이 모델은 인간 데이터에 대한 확장 법칙을 보여주며, 보지 못한 로봇 데이터에 제로샷 전이를 수행하고, 비디오 예측이 교차 체현 일반화를 주도한다는 것을 입증합니다. Dyna-2는 공개 체크포인트, API, 라이선스 없이 벤더 운영 Dyna 로봇 셀의 일부로만 제공됩니다.
Dyna Robotics는 로봇 조작을 위해 설계된 월드 액션 모델인 Dyna-2를 공개했습니다. 이 모델은 백만 시간 이상의 자기중심적 인간 비디오(약 170년에 해당하는 연속적인 깨어 있는 경험)로 사전 훈련되었습니다. 이 모델은 비디오와 액션의 분리된 토크나이제이션 및 처리를 갖춘 트랜스포머 혼합을 사용하며, 플로우 매칭을 이용한 비디오 확산 백본을 사용합니다. 회사는 세 가지 주요 스케일링 결과를 보고합니다: 백만 시간까지의 인간 데이터에 대한 스케일링 법칙이 성립하고, 이 법칙은 39개 작업에 걸쳐 보이지 않는 로봇 데이터에 제로샷으로 전이되며, 비디오 예측(액션 데이터가 아님)이 교차 체현 일반화를 주도합니다. 세 가지 체현에 걸친 14개 작업에 대한 온로봇 사후 훈련에서 데이터 사다리에 걸쳐 평균 정규화 점수가 20%에서 53%로 증가했으며, Lockbox Key Turning과 같은 특정 개선은 90% 성공률에 도달했습니다. Dyna-2는 다운로드 가능한 가중치로 제공되지 않으며, 배포하려면 Dyna 로봇 셀을 구매해야 합니다. 이 모델은 온로봇 테스트와 보이지 않는 고객 사이트에서 회사의 프로덕션 VLA인 Dyna-1을 능가했으며, 생산 기준을 통과한 비율은 Dyna-1의 46%에 비해 87%였습니다. 기술 보고서는 추가 읽기를 위해 제공됩니다.
출처: MarkTechPost —
원문
