애플리케이션연구 🇷🇺 24.07.2026 02:02

Lenta Tech, 움직이는 로봇의 영상에서 가격표를 검색한 방법: 비디오 분석 해커톤 결과

UltralyticsUltralytics PaddleOCR (Baidu)PaddleOCR (Baidu) OpenCVOpenCV EasyOCR (Jaided AI)EasyOCR (Jaided AI) Tesseract OCR (Google)Tesseract OCR (Google)
Lenta Tech 팀(Lenta 그룹의 IT 브랜드)이 움직이는 로봇이 촬영한 영상에서 가격표를 인식하는 해커톤을 진행한 경험을 공유했습니다. 이 글에서는 YOLO를 사용한 가격표 탐지부터 OCR, QR 코드, 카탈로그를 통한 데이터 추출까지의 솔루션 파이프라인을 설명합니다. 핵심 요점: 품질은 단일 모델이 아니라 프레임 시퀀스의 적절한 처리(추적, 최적 프레임 선택)와 OCR, QR, 카탈로그의 결합을 통해 달성됩니다.
Lenta Group의 IT 브랜드인 Lenta Tech 팀은 2025년에 Lenta Tech Life Hack이라는 해커톤을 개최했습니다. 이 해커톤은 슈퍼마켓 선반을 따라 이동하는 로봇이 촬영한 영상에서 가격표를 인식하는 데 중점을 두었습니다. 이 작업은 단순한 사각형 감지와 광학 문자 인식보다 훨씬 어려웠는데, 그 이유는 모션 블러, 눈부심, 다양한 각도, 부분적인 가림, 그리고 다양한 가격표 형식 때문이었습니다. 참가자들은 주류, 유제품, 꿀 등 다양한 매장 구역에서 촬영된 영상(정지 상태와 연속 이동 상태 모두 포함)을 제공받았으며, 출력은 제품명, 가격, 바코드, 재고 관리 단위(SKU), 인쇄 날짜, 진열 구역, 좌표, 타임스탬프, QR 코드 데이터 등의 필드를 포함한 CSV 파일이어야 했습니다. 제한 사항으로는 로컬 오픈소스 모델만 사용하고 외부 온라인 서비스나 클라우드 API는 금지되었으며, rknn int8에 최적화하는 것이 권장되었습니다. 평가 지표는 80% 이상의 정확도로 인식된 가격표의 비율이었습니다. 첫 번째 라운드에서 문제는 감지뿐만 아니라 올바른 판독과 데이터 구조화에도 있음이 드러났습니다. 성공적인 솔루션은 계단식 파이프라인을 사용했습니다: 추적 및 최적 프레임 선택(가장 선명하고, 가장 크며, 정면에 가까운 프레임), 감지(주로 YOLO/Ultralytics), 보정 및 초해상도, 영역별 광학 문자 인식(PaddleOCR, EasyOCR, Tesseract)과 정규 표현식 및 비즈니스 규칙을 통한 필드 검증, 그리고 QR/바코드 및 퍼지 매칭을 통한 카탈로그 데이터 복구입니다. 최종 단계에서 평균 품질은 4.47% 포인트 향상되었으며, 최대 증가폭은 각각 +21.27% 포인트와 +19.48% 포인트로, 이는 추적, 최적 프레임 점수, QR 복구, 카탈로그 검색, 무결성 검사, 도커 패키징을 통해 달성되었습니다. 우승 접근 방식은 단일 모델이 아닌 계단식 아키텍처였습니다. 좋은 성과를 낸 스택은 다음과 같습니다: YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, QR/바코드, 카탈로그/재고 관리 단위/퍼지 검색, 추적 및 최적 프레임 선택. "가격표를 찾은 후 어떻게든 해결하자"는 접근 방식은 통하지 않았습니다. 가격표 구조와 반복 프레임을 고려하지 않았기 때문입니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스