샤오미 MiLM Plus 팀, 인식 정렬 객체 제거 지표 RC-S와 RC-T 및 실제 비디오 벤치마크를 포함한 PROVE 공개
샤오미의 MiLM Plus 팀은 비디오에서 객체 제거를 평가하기 위한 인식 정렬 지표 세트인 PROVE와 실제 벤치마크를 공개했습니다. RC-S와 RC-T 지표는 DINOv2 특징에 대한 로컬 분포 매칭을 사용하며 기준 실측값을 요구하지 않습니다. PROVE는 인간 순위와의 상관관계에서 기존 지표보다 우수한 성능을 보여줍니다.
객체 제거 모델은 이를 평가하는 지표보다 빠르게 발전해 왔고, 그 결과 기존 지표들이 결과물의 순위를 잘못 매기는 일이 잦아졌다. Xiaomi의 MiLM Plus 팀이 ACM MM(Association for Computing Machinery International Conference on Multimedia) 2026에 채택된 PROVE를 공개했다. PROVE는 공간적 일관성을 측정하는 RC-S와 시간적 일관성을 측정하는 RC-T라는 두 가지 지표와 함께, 2단계 구조의 비디오 벤치마크인 PROVE-Bench를 포함한다. 두 지표 모두 DINOv2 특징 위에서 슬라이딩 윈도우 방식의 최대 평균 불일치(Maximum Mean Discrepancy, MMD)를 적용해 편집된 영역을 국소적으로 평가하며, 참조 비디오 없이도 사용할 수 있다. PROVE는 Apache 2.0 라이선스의 PyTorch 저장소 형태로 제공된다. 이 지표들은 기존 지표의 여러 문제를 해결한다. PSNR(Peak Signal-to-Noise Ratio, 최고 신호 대 잡음비), SSIM(Structural Similarity Index, 구조적 유사도), LPIPS(Learned Perceptual Image Patch Similarity, 학습 기반 지각적 이미지 패치 유사도)는 원본을 그대로 복사해 붙여 넣은 결과에 편향되는 경향이 있고, ReMOVE와 CFD는 흐릿한 출력에 높은 점수를 주는 반면 환각(hallucination)이 포함된 결과물에는 오작동한다. 시간적 지표들 역시 손상에 둔감하다는 문제가 있다. RC-S는 인간의 순위 평가와 비교해 평균 Kendall's tau(켄달 타우) 0.59를 기록하며 ReMOVE(0.26)와 CFD(0.16)를 큰 격차로 앞섰다. PROVE-Bench는 쌍을 이룬 비디오 80개로 구성된 PROVE-M과, 정답(ground truth)이 없는 고난도 비디오 100개로 구성된 PROVE-H를 포함한다. 코드와 데이터셋은 모두 공개되어 있으며, RC-S는 프레임당 134.6ms의 속도로 동작해 CFD보다 13.7배 빠르다.
출처: MarkTechPost —
원문
