ほぼ200度の視野:フィッシュアイ画像での最先端深度推定モデルのテスト
Habrの機械学習ハブの研究者たちは、フィッシュアイ画像での深度推定モデルを評価するためのベンチマーク「WideDepth」を作成した。14の最先端モデルをテストした結果、単眼モデルは超広視野に特に敏感であり、視野が120度から195度に広がると誤差が160%以上増加することが明らかになった。このベンチマークにより、異なる視野、ステレオベースライン、カメラ向きにわたるモデルの制御比較が可能になる。
WideDepthベンチマークは、魚眼画像における深度推定モデルを評価するために作成されました。これは、適切な実世界の屋内魚眼データセットが不足しているという問題に対処するものです。このベンチマークは、地上型レーザースキャナーで捉えた101のオフィスシーンに基づいており、ミリメートル精度のグラウンドトゥルース深度を提供します。また、水平視野角(FOV)120度、140度、165度、195度の画像、20ミリメートルから300ミリメートルのステレオベースライン、水平および垂直のカメラ方向を提供します。14の最先端(SOTA)モデルでのテストでは、単眼モデルであるDepth Anything V2とPatchFusionは、FOVが120度から195度に増加すると、それぞれ絶対相対誤差(AbsRel)が166パーセントと160パーセント跳ね上がりましたが、Depth Proはわずか9パーセントの増加でより堅牢でした。ステレオマッチングでは、正距円筒図法がキューブマップよりも大幅に優れており、EPE誤差を4.50ピクセルから1.07ピクセルに削減しました。コンパクトなBGNetモデルを魚眼データでファインチューニングしたところ、視差誤差が3ピクセルを超える画素の割合が24.3パーセントから9.3パーセントに改善され、62パーセントの改善となりました。このベンチマークには、ハンドヘルドセンサーで捉えた18,000組の屋外ステレオペアからなるトレーニングセットも含まれており、魚眼領域へのモデル適応をテストすることができます。
出典: Habr — хаб ML —
原文
