Cómo Lenta Tech buscó etiquetas de precio en vídeo de un robot en movimiento: resultados del hackathon de análisis de vídeo
Ultralytics
PaddleOCR (Baidu)
OpenCV
EasyOCR (Jaided AI)
Tesseract OCR (Google)
El equipo de Lenta Tech (marca informática del grupo Lenta) compartió su experiencia realizando un hackathon para reconocer etiquetas de precio a partir de vídeo capturado por un robot en movimiento. El artículo describe el flujo de trabajo de la solución: desde la detección de etiquetas de precio con YOLO hasta la extracción de datos mediante OCR, códigos QR y un catálogo. Las conclusiones clave: la calidad no se logra con un solo modelo, sino gestionando adecuadamente las secuencias de fotogramas (seguimiento, selección del mejor fotograma) y combinando OCR, QR y catálogo.
El equipo de Lenta Tech, la marca de TI del grupo Lenta, organizó un hackathon en 2025 llamado Lenta Tech Life Hack, centrado en el reconocimiento de etiquetas de precios a partir de grabaciones de video capturadas por un robot que se desplaza a lo largo de estanterías en supermercados. La tarea resultó más compleja que la simple detección de rectángulos y el reconocimiento óptico de caracteres (OCR, por sus siglas en inglés), debido al desenfoque de movimiento, reflejos, ángulos variables, occlusiones parciales y una gran diversidad de formatos de etiquetas de precio. A los participantes se les proporcionaron grabaciones de video de diferentes zonas de la tienda (alcohol, lácteos, miel, etc.) tanto con paradas como con movimiento continuo; la salida debía ser un archivo CSV con los campos: nombre del producto, precios, código de barras, SKU (unidad de mantenimiento de existencias, por sus siglas en inglés), fecha de impresión, zona de exposición, coordenadas, marca de tiempo y datos de códigos QR. Las restricciones incluían el uso exclusivo de modelos locales de código abierto, sin servicios externos en línea ni API en la nube, y se fomentaba la optimización para rknn int8. La métrica de evaluación fue la proporción de etiquetas de precio reconocidas con al menos un 80 % de precisión. La primera ronda mostró que el problema no solo radicaba en la detección, sino también en la lectura correcta y la estructuración de datos. Las soluciones exitosas utilizaron un pipeline en cascada: seguimiento y selección del mejor fotograma (el más nítido, el más grande, el más frontal), detección (principalmente YOLO/Ultralytics), rectificación y superresolución, OCR zonal (PaddleOCR, EasyOCR, Tesseract) con validación de campos mediante expresiones regulares y reglas de negocio, y recuperación de datos a partir de códigos QR/códigos de barras y un catálogo con búsqueda difusa. En la fase final, la calidad media mejoró en 4.47 puntos porcentuales, con incrementos máximos de +21.27 y +19.48 puntos porcentuales, logrados mediante seguimiento, puntuación del mejor fotograma, recuperación de códigos QR, búsqueda en catálogo, comprobaciones de coherencia y empaquetado con Docker. El enfoque ganador fue una arquitectura en cascada en lugar de un modelo único. Las pilas que funcionaron bien incluyeron: YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, códigos QR/códigos de barras, catálogo/SKU/búsqueda difusa, seguimiento y selección del mejor fotograma. El enfoque de 'encontrar una etiqueta de precio y luego descifrarla de alguna manera' no funcionó, sin tener en cuenta la estructura de la etiqueta de precio y los fotogramas repetidos.
Fuente: Habr — хаб ИИ —
original
