Lenta Tech 如何从移动机器人拍摄的视频中搜索价格标签:视频分析黑客马拉松成果
Ultralytics
PaddleOCR (Baidu)
OpenCV
EasyOCR (Jaided AI)
Tesseract OCR (Google)
Lenta Tech 团队(Lenta 集团的 IT 品牌)分享了他们举办黑客马拉松的经验,主题是从移动机器人拍摄的视频中识别价格标签。文章描述了解决方案流程:从使用 YOLO 检测价格标签,到通过 OCR、二维码和目录提取数据。关键收获:质量不是由单一模型实现的,而是通过正确处理帧序列(跟踪、选择最佳帧)以及结合 OCR、二维码和目录来实现的。
Lenta 集团的 IT 品牌“Lenta Tech”团队于 2025 年举办了一场名为“Lenta Tech Life Hack”的黑客马拉松,其焦点是识别超市中沿货架移动的机器人所拍摄视频中的价格标签。这项任务远比简单的矩形检测和光学字符识别(OCR)更具挑战性,原因在于运动模糊、反光、各种角度、部分遮挡以及多种价格标签格式。主办方提供了来自不同商店区域(如酒类、乳制品、蜂蜜等)的视频录像,其中包含停止和连续运动两种情况;输出必须是一个 CSV 文件,字段包括:产品名称、价格、条形码、库存单位(SKU)、打印日期、展示区域、坐标、时间戳以及来自二维码的数据。限制条件包括仅可使用本地开源模型,不得使用外部在线服务或云 API,并鼓励针对 rknn int8 进行优化。评估指标为:至少 80% 正确识别价格标签的比例。第一轮结果显示,问题不仅在于检测,还在于正确读取和数据结构化。成功的解决方案采用了级联流程:跟踪和最佳帧选择(最清晰、最大、最正面的帧)、检测(主要使用 YOLO/Ultralytics)、校正和超分辨率、区域 OCR(PaddleOCR、EasyOCR、Tesseract)配合通过正则表达式和业务规则进行的字段验证,以及通过二维码/条形码和带有模糊匹配的目录进行数据恢复。在最后阶段,平均质量提高了 4.47 个百分点,最大提升幅度分别为 +21.27 和 +19.48 个百分点,这得益于跟踪、最佳帧评分、二维码恢复、目录搜索、合理性检查以及 Docker 打包。获胜方法是级联架构,而非单一模型。表现良好的技术栈包括:YOLO/Ultralytics、OpenCV、PaddleOCR、EasyOCR、Tesseract、二维码/条形码、目录/SKU/模糊搜索、跟踪和最佳帧选择。“找到价格标签然后想办法搞定”的方法行不通——因为没有考虑价格标签结构和重复帧。
来源: Habr — хаб ИИ —
原文
