칸딘스키 WM 1.0: 물리 AI를 위한 생성 모델
Сбер
NVIDIA
Meta
스베르(Sber)가 자율주행 차량, 로보틱스, 복잡한 물리 장면을 위해 설계된 세 가지 이미지-투-비디오 모델 세트인 칸딘스키 WM 1.0을 출시했습니다. 이 모델들은 칸딘스키 5.0 비디오 라이트(Kandinsky 5.0 Video Lite) 기반으로, MIT 라이선스 하에 제공되며, 물리적으로 정확한 합성 비디오를 생성하여 물리 AI의 데이터 부족 문제를 해결하는 것을 목표로 합니다.
Sber가 Physical AI를 위한 세 가지 특화 비디오 생성 모델 세트인 Kandinsky WM 1.0을 오픈소스로 공개했습니다. K5-AV는 자율주행차, K5-RO는 로보틱스, K5-PH는 복잡한 물리 현상이 있는 장면을 위한 모델입니다. 이 모델들은 20억 파라미터의 Kandinsky 5.0 Video Lite를 기반으로 하며, 이미지-투-비디오 모드로 작동하여 첫 프레임과 텍스트 프롬프트를 입력받아 연속된 영상을 생성합니다. 각 모델은 특정 데이터셋에 대해 도메인 적응을 거쳤습니다: NVIDIA PhysicalAI 자율주행 차량 데이터 150만 개, GenRobot 10Kh RealOmni와 AgiBot World Beta를 포함한 다양한 소스의 로보틱스 비디오 220만 개, 그리고 사전 학습 데이터 130만 개와 수동으로 선별된 30만 개를 포함한 물리 비디오 160만 개입니다. 도메인 적응 후, 모델들은 두 번째 훈련 단계를 거쳤습니다: K5-AV와 K5-RO는 보상 모델을 사용한 강화 학습, K5-PH는 SOAR를 사용했습니다. 이번 릴리스에는 MIT 라이선스 하에 코드와 가중치가 포함되어 있습니다. 기사는 또한 Physical AI에서 드물지만 중요한 시나리오를 수집하기 어려운 롱테일 데이터 문제를 강조하고, 현재의 비디오 생성 모델은 종종 물리적 정확성이 부족하여 도메인 특화 훈련과 사후 훈련이 필요하다고 언급합니다.
출처: Habr — хаб ML —
원문
