Casi 200 grados de visión: probando modelos de estimación de profundidad de última generación en ojo de pez
Investigadores del hub de ML de Habr crearon WideDepth, un benchmark para evaluar modelos de estimación de profundidad en imágenes de ojo de pez. Probar 14 modelos de última generación reveló que los modelos monoculares son particularmente sensibles a campos de visión ultra amplios, con errores que aumentan más del 160% al pasar de 120° a 195°. El benchmark permite una comparación controlada de modelos en diferentes FOV, líneas base estéreo y orientaciones de cámara.
El benchmark WideDepth se creó para evaluar modelos de estimación de profundidad en imágenes de ojo de pez, abordando la falta de conjuntos de datos de interiores reales adecuados. Se basa en 101 escenas de oficina capturadas con un escáner láser terrestre, proporcionando profundidad de referencia con precisión milimétrica, y ofrece imágenes con campos de visión horizontales de 120°, 140°, 165° y 195°, líneas base estéreo de 20 a 300 mm, y orientaciones de cámara tanto horizontales como verticales. Las pruebas en 14 modelos de última generación mostraron que los modelos monoculares como Depth Anything V2 y PatchFusion ven su error AbsRel saltar un 166% y un 160% respectivamente cuando el campo de visión aumenta de 120° a 195°, mientras que Depth Pro es más robusto con solo un aumento del 9%. Para la correspondencia estéreo, la proyección equirrectangular resultó ser significativamente mejor que el cubemap, reduciendo el error EPE de 4.50 a 1.07 píxeles. El ajuste fino del modelo compacto BGNet en datos de ojo de pez mejoró el porcentaje de píxeles con error de disparidad superior a 3 píxeles del 24.3% al 9.3%, una mejora del 62%. El benchmark también incluye un conjunto de entrenamiento de 18,000 pares estéreo al aire libre capturados con sensores de mano para probar la adaptación del modelo al dominio de ojo de pez.
Fuente: Habr — хаб ML —
original
