Neredeyse 200 Derece Görüş: Balık Gözü Üzerinde SOTA Derinlik Tahmin Modellerinin Test Edilmesi
Habr'ın ML merkezinden araştırmacılar, balık gözü görüntülerinde derinlik tahmin modellerini değerlendirmek için WideDepth benchmark'ını oluşturdu. 14 son teknoloji modelin test edilmesi, tek gözlü modellerin ultra geniş görüş alanlarına özellikle duyarlı olduğunu ve 120°'den 195°'ye çıkıldığında hataların %160'ın üzerinde arttığını ortaya koydu. Benchmark, farklı görüş alanları, stereo taban çizgileri ve kamera yönelimleri arasında kontrollü model karşılaştırması sağlıyor.
WideDepth benchmark'i, balık gözü görüntülerde derinlik tahmin modellerini değerlendirmek için oluşturulmuş olup, uygun gerçek iç mekan balık gözü veri setlerinin eksikliğini gidermektedir. Karasal lazer tarayıcı ile yakalanan 101 ofis sahnesine dayanır ve milimetre hassasiyetinde yer gerçeği derinliği sağlar; ayrıca 120°, 140°, 165° ve 195° yatay görüş alanlarına (FOV) sahip görüntüler, 20 ila 300 mm arasında stereo taban çizgileri ve hem yatay hem de dikey kamera yönelimleri sunar. 14 SOTA model üzerinde yapılan testler, Depth Anything V2 ve PatchFusion gibi monoküler modellerin, FOV 120°'den 195°'ye çıktığında sırasıyla %166 ve %160 oranında AbsRel hata artışı yaşadığını, Depth Pro'nun ise yalnızca %9 artışla daha sağlam olduğunu gösterdi. Stereo eşleştirme için, equirectangular projeksiyonun cubemap'ten önemli ölçüde daha iyi olduğu kanıtlandı ve EPE hatası 4.50 pikselden 1.07 piksele düşürüldü. Balık gözü verileri üzerinde kompakt BGNet modelinin ince ayarı, 3 piksel üzeri disparity hatası olan piksel yüzdesini %24.3'ten %9.3'e iyileştirdi ve bu da %62'lik bir gelişme sağladı. Benchmark ayrıca, modellerin balık gözü alanına uyumunu test etmek için el tipi sensörlerle yakalanan 18.000 dış mekan stereo çiftinden oluşan bir eğitim seti içerir.
Kaynak: Habr — хаб ML —
orijinal
