Bijna 200 graden beeldhoek: testen van state-of-the-art diepteschattingsmodellen op fisheye
Onderzoekers van Habr's ML-hub hebben WideDepth gecreëerd, een benchmark voor het evalueren van diepteschattingsmodellen op fisheye-beelden. Het testen van 14 state-of-the-art modellen toonde aan dat monoscopische modellen bijzonder gevoelig zijn voor ultrabrede beeldhoeken, met fouten die met meer dan 160% toenemen bij een overgang van 120° naar 195°. De benchmark maakt gecontroleerde vergelijking van modellen mogelijk over verschillende beeldhoeken, stereo-basissen en camera-orintaties.
De WideDepth-benchmark is gecreëerd om diepteschattingsmodellen te evalueren op fisheye-beelden, waarmee het gebrek aan geschikte echte binnenshuis fisheye-datasets wordt aangepakt. Deze is gebaseerd op 101 kantooromgevingen die zijn vastgelegd met een terrestrische laserscanner, wat ground truth-diepte met millimeter-nauwkeurigheid oplevert, en biedt beelden met horizontale beeldhoeken van 120°, 140°, 165° en 195°, stereobaselijnen van 20 tot 300 mm, en zowel horizontale als verticale camerastandpunten. Tests op 14 state-of-the-art-modellen toonden aan dat monoculaire modellen zoals Depth Anything V2 en PatchFusion een stijging van respectievelijk 166% en 160% in hun AbsRel-fout zien wanneer de beeldhoek toeneemt van 120° naar 195°, terwijl Depth Pro robuuster is met slechts een toename van 9%. Voor stereomatching bleek de equirectangulaire projectie significant beter dan cubemap, waardoor de EPE-fout afnam van 4,50 naar 1,07 pixels. Het fine-tunen van het compacte BGNet-model op fisheye-data verbeterde het percentage pixels met een dispariteitsfout van meer dan 3 pixels van 24,3% naar 9,3%, een verbetering van 62%. De benchmark omvat ook een trainingsset van 18.000 buiten-stereoparen die zijn vastgelegd met handheld-sensoren om de adaptatie van modellen aan het fisheye-domein te testen.
Bron: Habr — хаб ML —
origineel
