AplicaçõesPesquisa 🇷🇺 24.07.2026 02:02

Como a Lenta Tech Buscou Etiquetas de Preço em Vídeo de um Robô em Movimento: Resultados do Hackathon de Análise de Vídeo

UltralyticsUltralytics PaddleOCR (Baidu)PaddleOCR (Baidu) OpenCVOpenCV EasyOCR (Jaided AI)EasyOCR (Jaided AI) Tesseract OCR (Google)Tesseract OCR (Google)
A equipe da Lenta Tech (marca de TI do Grupo Lenta) compartilhou sua experiência na realização de um hackathon sobre reconhecimento de etiquetas de preço a partir de vídeo capturado por um robô em movimento. O artigo descreve o pipeline da solução: desde a detecção de etiquetas de preço usando YOLO até a extração de dados via OCR, QR codes e um catálogo. Principais conclusões: a qualidade é alcançada não por um único modelo, mas pelo tratamento adequado de sequências de quadros (rastreamento, seleção do melhor quadro) e pela combinação de OCR, QR e catálogo.
A equipe Lenta Tech, braço de TI do Grupo Lenta, realizou um hackathon em 2025 chamado Lenta Tech Life Hack, focado no reconhecimento de etiquetas de preço a partir de vídeos capturados por um robô que se desloca ao longo das prateleiras de supermercados. A tarefa mostrou-se mais desafiadora do que a simples detecção de retângulos e reconhecimento óptico de caracteres (OCR), devido a desfoque de movimento, brilho, ângulos variados, oclusões parciais e uma grande variedade de formatos de etiquetas de preço. Os participantes receberam gravações de vídeo de diferentes zonas da loja (bebidas alcoólicas, laticínios, mel, etc.) com paradas e movimento contínuo; a saída deveria ser um arquivo CSV com campos: nome do produto, preços, código de barras, SKU (unidade de manutenção de estoque), data de impressão, zona de exposição, coordenadas, carimbo de data/hora e dados de códigos QR. As restrições incluíam usar apenas modelos locais de código aberto, sem serviços externos online ou APIs em nuvem, e a otimização para rknn int8 foi incentivada. A métrica de avaliação: a proporção de etiquetas de preço reconhecidas com pelo menos 80% de precisão. A primeira rodada mostrou que o problema não estava apenas na detecção, mas também na leitura correta e estruturação dos dados. Soluções bem-sucedidas usaram um pipeline em cascata: rastreamento e seleção do melhor quadro (mais nítido, maior, mais frontal), detecção (principalmente YOLO/Ultralytics), retificação e super-resolução, OCR por zona (PaddleOCR, EasyOCR, Tesseract) com validação de campo via expressões regulares e regras de negócio, e recuperação de dados de QR/códigos de barras e de um catálogo com correspondência aproximada (fuzzy matching). Na etapa final, a qualidade média melhorou em 4,47 pontos percentuais, com ganhos máximos de +21,27 e +19,48 pontos percentuais, alcançados por meio de rastreamento, pontuação do melhor quadro, recuperação de QR, pesquisa em catálogo, verificações de sanidade e empacotamento em Docker. A abordagem vencedora foi uma arquitetura em cascata, em vez de um único modelo. Pilhas que tiveram bom desempenho incluíram: YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, QR/códigos de barras, pesquisa em catálogo/SKU/fuzzy, rastreamento e seleção do melhor quadro. A abordagem 'encontre uma etiqueta de preço e depois descubra de alguma forma' não funcionou — sem levar em conta a estrutura da etiqueta de preço e os quadros repetidos.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas