Cómo Lenta Tech buscó etiquetas de precios en video desde un robot en movimiento: resultados de un hackathon de videovigilancia analítica
Ultralytics
PaddleOCR (Baidu)
OpenCV
EasyOCR (Jaided AI)
Tesseract OCR (Google)
El equipo de Lenta Tech (la marca de TI del Grupo Lenta) compartió su experiencia en la organización de un hackathon sobre reconocimiento de etiquetas de precios a partir de video grabado por un robot en movimiento. El artículo describe el flujo de trabajo de la solución: desde la detección de etiquetas mediante YOLO hasta la extracción de datos a través de OCR, códigos QR y un catálogo. Conclusiones clave: la calidad se logra no con un solo modelo, sino con el manejo adecuado de la secuencia de fotogramas (seguimiento, selección del mejor fotograma) y la combinación de OCR, QR y el catálogo.
En 2025, el equipo de Lenta Tech, la marca de TI del 'Grupo Lenta', organizó un hackatón llamado Lenta Tech Life Hack, centrado en el reconocimiento de etiquetas de precios a partir de video grabado por un robot que se desplaza a lo largo de los estantes en supermercados. La tarea resultó ser más compleja que una simple detección de rectángulos y OCR, debido al desenfoque, los reflejos, los diferentes ángulos, las superposiciones parciales y los múltiples formatos de las etiquetas. A los participantes se les proporcionaron grabaciones de video de distintas zonas de la tienda (alcohol, lácteos, miel, etc.) con paradas y movimiento continuo; el resultado debía ser un archivo CSV con los campos: nombre del producto, precios, código de barras, SKU, fecha de impresión, zona de exhibición, coordenadas, marca de tiempo ('timestamp') y datos del código QR. Las restricciones incluían únicamente modelos locales de código abierto, sin servicios externos en línea ni API en la nube, y se valoraba la optimización para 'rknn int8'. La métrica de evaluación fue la proporción de etiquetas reconocidas con una precisión no inferior al 80%. La primera ronda reveló que el problema no solo radicaba en la detección, sino también en la lectura correcta y la estructuración de los datos. Las soluciones exitosas utilizaron un flujo de trabajo en cascada: seguimiento ('tracking') y selección del mejor fotograma ('best frame' con mejor nitidez, tamaño y frontalidad), detección (principalmente YOLO/Ultralytics), rectificación y superresolución (SR), OCR zonal (PaddleOCR, EasyOCR, Tesseract) con verificación de campos mediante expresiones regulares y reglas de negocio, así como recuperación de datos a partir de códigos QR/códigos de barras y un catálogo con coincidencia aproximada ('fuzzy matching'). En la final, la calidad promedio aumentó en 4,47 puntos porcentuales, con incrementos máximos de +21,27 y +19,48 puntos porcentuales gracias al seguimiento, la puntuación del mejor fotograma ('best-frame scoring'), la recuperación mediante código QR, la búsqueda en el catálogo, las comprobaciones de cordura ('sanity checks') y el empaquetado en Docker. La mejor solución resultó ser una arquitectura en cascada, no un modelo único. Las tecnologías que demostraron ser efectivas incluyeron: YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, códigos QR/códigos de barras, catálogo/SKU/búsqueda aproximada, seguimiento y selección del mejor fotograma. El enfoque 'encontremos la etiqueta y luego ya veremos' no funcionó, ya que no tenía en cuenta la estructura de la etiqueta ni los fotogramas repetidos.
Fuente: Habr — хаб ИИ —
original
