التطبيقاتالأبحاث 🇷🇺 24.07.2026 02:02

كيف بحثت لينتا تك عن بطاقات الأسعار على فيديو من روبوت متحرك: نتائج هاكاثون تحليلات الفيديو

UltralyticsUltralytics PaddleOCR (Baidu)PaddleOCR (Baidu) OpenCVOpenCV EasyOCR (Jaided AI)EasyOCR (Jaided AI) Tesseract OCR (Google)Tesseract OCR (Google)
شارك فريق لينتا تك (العلامة التجارية لتقنية المعلومات لمجموعة لينتا) تجربتهم في إجراء هاكاثون حول التعرف على بطاقات الأسعار من فيديو تم التقاطه بواسطة روبوت متحرك. تصف المقالة مسار الحل: من اكتشاف بطاقات الأسعار باستخدام واي أو إل أو إلى استخراج البيانات عبر التعرف الضوئي على الحروف (أو سي آر) ورموز الاستجابة السريعة (كيو آر) والكتالوج. النقاط الرئيسية: الجودة لا تتحقق من خلال نموذج واحد، بل بالتعامل السليم مع تسلسلات الإطارات (التتبع، اختيار أفضل إطار) والجمع بين أو سي آر وكيو آر والكتالوج.
Команда Lenta Tech, IT-бренд группы «Лента», провела в 2025 году хакатон под названием Lenta Tech Life Hack, посвящённый распознаванию ценников по видео, снятому роботом, движущимся вдоль полок в супермаркетах. Задача оказалась сложнее простого обнаружения прямоугольников и оптического распознавания символов (OCR) из-за смазывания при движении, бликов, различных углов обзора, частичных перекрытий и большого разнообразия форматов ценников. Участникам предоставили видеозаписи из разных зон магазина (алкоголь, молочка, мёд и т.д.) с остановками и непрерывным движением; на выходе требовался CSV-файл с полями: наименование товара, цены, штрих-код (barcode), артикул (SKU), дата печати, зона выкладки, координаты, временная метка и данные из QR-кодов. Ограничения: использование только локальных open-source моделей, запрет внешних онлайн-сервисов или облачных API, поощрялась оптимизация под rknn int8. Метрика оценки: доля ценников, распознанных с точностью не менее 80%. Первый тур показал, что проблема заключалась не только в обнаружении, но и в корректном чтении и структурировании данных. Успешные решения использовали каскадный конвейер: отслеживание (tracking) и выбор наилучшего кадра (самого чёткого, крупного, фронтального), детекцию (в основном YOLO/Ultralytics), выпрямление и супер-разрешение, зональное OCR (PaddleOCR, EasyOCR, Tesseract) с валидацией полей через регулярные выражения и бизнес-правила, а также восстановление данных из QR/штрих-кодов и каталога с нечётким поиском (fuzzy matching). На финальном этапе среднее качество улучшилось на 4,47 процентных пункта, максимальный прирост составил +21,27 и +19,48 процентных пункта, что было достигнуто за счёт отслеживания, оценки лучшего кадра, восстановления из QR, поиска по каталогу, проверок на адекватность и упаковки в Docker. Победным оказался каскадный подход, а не единая модель. Стеки, показавшие хорошие результаты, включали: YOLO/Ultralytics, OpenCV, PaddleOCR, EasyOCR, Tesseract, QR/штрих-коды, каталог/SKU/нечёткий поиск, отслеживание и выбор лучшего кадра. Подход «найти ценник и потом как-нибудь разобраться» не сработал — без учёта структуры ценника и повторяющихся кадров.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة