Comment Lenta Tech a cherché des étiquettes de prix sur une vidéo depuis un robot en mouvement : résultats du hackathon d'analyse vidéo
Ultralytics
PaddleOCR (Baidu)
OpenCV
EasyOCR (Jaided AI)
Tesseract OCR (Google)
L'équipe Lenta Tech (marque informatique du groupe Lenta) a partagé son expérience d'organisation d'un hackathon sur la reconnaissance d'étiquettes de prix à partir de vidéos capturées par un robot en mouvement. L'article décrit le pipeline de solution : de la détection des étiquettes de prix avec YOLO à l'extraction des données via OCR, codes QR et catalogue. Points clés : la qualité n'est pas obtenue par un seul modèle mais par un traitement approprié des séquences d'images (suivi, sélection de la meilleure image) et la combinaison de l'OCR, des QR et du catalogue.
L'équipe Lenta Tech, la marque IT du groupe Lenta, a organisé en 2025 un hackathon baptisé Lenta Tech Life Hack, axé sur la reconnaissance des étiquettes de prix à partir de séquences vidéo capturées par un robot se déplaçant le long des rayons des supermarchés. La tâche s'est avérée plus complexe qu'une simple détection de rectangles et OCR, en raison du flou de mouvement, des reflets, des angles variables, des occlusions partielles et d'une grande diversité de formats d'étiquettes. Les participants ont reçu des enregistrements vidéo de différentes zones du magasin (alcools, produits laitiers, miel, etc.) avec des arrêts et des mouvements continus ; le résultat devait être un fichier CSV avec les champs : nom du produit, prix, code-barres, SKU, date d'impression, zone d'affichage, coordonnées, horodatage et données des codes QR. Les restrictions comprenaient l'utilisation exclusive de modèles open-source locaux, sans services externes en ligne ni API cloud, et l'optimisation pour rknn int8 était encouragée. La métrique d'évaluation : la proportion d'étiquettes de prix reconnues avec une précision d'au moins 80 %. Le premier tour a montré que le problème ne résidait pas seulement dans la détection, mais aussi dans la lecture correcte et la structuration des données. Les solutions retenues utilisaient un pipeline en cascade : suivi et sélection de la meilleure image (la plus nette, la plus grande, la plus frontale), détection (principalement YOLO/Ultralytics), redressement et super-résolution, OCR zonal (PaddleOCR, EasyOCR, Tesseract) avec validation des champs via des expressions régulières et des règles métier, et récupération des données à partir des QR/code-barres et d'un catalogue avec correspondance floue. Lors de l'étape finale, la qualité moyenne s'est améliorée de 4,47 points de pourcentage, avec des gains maximaux de +21,27 et +19,48 points de pourcentage, obtenus grâce au suivi, au calcul du score de la meilleure image, à la récupération QR, à la recherche dans le catalogue, aux vérifications de cohérence et au packaging Docker. L'approche gagnante était une architecture en cascade plutôt qu'un modèle unique. Les piles performantes comprenaient : YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, QR/code-barres, catalogue/SKU/recherche floue, suivi et sélection de la meilleure image. L'approche « trouver une étiquette de prix et ensuite se débrouiller » n'a pas fonctionné — sans tenir compte de la structure de l'étiquette de prix et des images répétées.
Source: Habr — хаб ИИ —
original
