Près de 200 degrés de champ de vision : test de modèles d'estimation de profondeur SOTA sur fisheye
Des chercheurs du hub ML de Habr ont créé WideDepth, un benchmark pour évaluer les modèles d'estimation de profondeur sur des images fisheye. Les tests de 14 modèles de pointe ont révélé que les modèles monoculaires sont particulièrement sensibles aux champs de vision ultra-larges, avec des erreurs augmentant de plus de 160 % en passant de 120° à 195°. Le benchmark permet une comparaison contrôlée des modèles à travers différents champs de vision, lignes de base stéréo et orientations de caméra.
Le benchmark WideDepth a été créé pour évaluer les modèles d'estimation de profondeur sur des images fisheye, répondant au manque de jeux de données fisheye réels en intérieur. Il repose sur 101 scènes de bureaux capturées avec un scanner laser terrestre, fournissant une vérité terrain de profondeur avec une précision millimétrique, et propose des images avec des champs de vision horizontaux de 120°, 140°, 165° et 195°, des lignes de base stéréo de 20 à 300 mm, ainsi que des orientations de caméra horizontales et verticales. Les tests sur 14 modèles de pointe ont montré que les modèles monoculaires comme Depth Anything V2 et PatchFusion voient leur erreur AbsRel bondir de 166 % et 160 % respectivement lorsque le FOV passe de 120° à 195°, tandis que Depth Pro est plus robuste avec seulement une augmentation de 9 %. Pour la correspondance stéréo, la projection équirectangulaire s'est avérée nettement meilleure que le cubemap, réduisant l'erreur EPE de 4,50 à 1,07 pixels. Le réglage fin du modèle compact BGNet sur des données fisheye a amélioré le pourcentage de pixels avec une erreur de disparité supérieure à 3 pixels, le faisant passer de 24,3 % à 9,3 %, soit une amélioration de 62 %. Le benchmark comprend également un ensemble d'entraînement de 18 000 paires stéréo en extérieur capturées avec des capteurs portables pour tester l'adaptation des modèles au domaine fisheye.
Source: Habr — хаб ML —
original
