ToepassingenOnderzoek 🇷🇺 24.07.2026 02:02

Hoe Lenta Tech met een bewegende robot prijskaartjes zocht op video: resultaten van de Video Analytics Hackathon

UltralyticsUltralytics PaddleOCR (Baidu)PaddleOCR (Baidu) OpenCVOpenCV EasyOCR (Jaided AI)EasyOCR (Jaided AI) Tesseract OCR (Google)Tesseract OCR (Google)
Het Lenta Tech-team (IT-merk van de Lenta Group) deelde hun ervaring met het organiseren van een hackathon voor het herkennen van prijskaartjes uit video die door een bewegende robot is vastgelegd. Het artikel beschrijft de oplossingspijplijn: van het detecteren van prijskaartjes met YOLO tot het extraheren van gegevens via OCR, QR-codes en een catalogus. Belangrijkste inzichten: kwaliteit wordt niet bereikt door een enkel model, maar door de juiste omgang met framereeksen (tracking, selectie van het beste frame) en het combineren van OCR, QR en catalogus.
Het team van Lenta Tech, het IT-merk van de Lenta Groep, hield in 2025 een hackathon genaamd Lenta Tech Life Hack, gericht op het herkennen van prijskaartjes op videobeelden die zijn vastgelegd door een robot die langs schappen in supermarkten beweegt. De taak bleek uitdagender dan eenvoudige rechthoekdetectie en OCR, vanwege bewegingsonscherpte, reflecties, wisselende hoeken, gedeeltelijke occlusies en een grote verscheidenheid aan prijskaartformaten. Deelnemers kregen video-opnames uit verschillende winkelzones (alcohol, zuivel, honing, enz.) met zowel stops als continue beweging; de uitvoer moest een CSV-bestand zijn met de velden: productnaam, prijzen, barcode, SKU, afdrukdatum, displayzone, coördinaten, tijdstempel en gegevens van QR-codes. Beperkingen waren onder meer het gebruik van alleen lokale open-sourcemodellen, geen externe online services of cloud-API's, en optimalisatie voor rknn int8 werd aangemoedigd. De evaluatiemetriek: het aandeel prijskaartjes dat met ten minste 80% nauwkeurigheid werd herkend. De eerste ronde toonde aan dat het probleem niet alleen lag in detectie, maar ook in correct lezen en datastructurering. Succesvolle oplossingen gebruikten een trapsgewijze pijplijn: tracking en selectie van het beste frame (scherpste, grootste, meest frontale), detectie (meestal YOLO/Ultralytics), rectificatie en superresolutie, zonale OCR (PaddleOCR, EasyOCR, Tesseract) met veldvalidatie via reguliere expressies en bedrijfsregels, en gegevensherstel via QR/barcodes en een catalogus met fuzzy matching. In de laatste fase verbeterde de gemiddelde kwaliteit met 4,47 procentpunt, met maximale winsten van +21,27 en +19,48 procentpunt, bereikt door tracking, scoring van het beste frame, QR-herstel, cataloguszoekopdracht, sanity checks en Docker-verpakking. De winnende aanpak was een trapsgewijze architectuur in plaats van een enkel model. Stacks die goed presteerden, omvatten: YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, QR/barcodes, catalogus/SKU/fuzzy search, tracking en selectie van het beste frame. De aanpak 'zoek een prijskaartje en bedenk het dan maar' werkte niet - zonder rekening te houden met de structuur van het prijskaartje en herhaalde frames.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws