токена, что указывает на то, что более высокая скорость часто означает потерю содержимого. Специализированная модель PaddleOCR-VL (1.7B) превосходит универсальную Qwen2.5-VL-7B в 5,2 раза по страницам в минуту и в 6,7 раза по токенам в секунду. Нативный HF Transformers отстаёт от vLLM и SGLang в два раза для одной и той же модели из-за более низкой загрузки графического процессора. Бенчмарки показывают, что для простых печатных документов достаточно CPU-версий Tesseract или RapidOCR, в то время как для сложных макетов, таблиц и вывода в формате Markdown рекомендуется PaddleOCR-VL с SGLang, а для продакшена с минимальными рисками совместимости — PaddleOCR-VL с vLLM. Для универсальных задач подходит Qwen2.5-VL-7B с vLLM, а для локальной RU-доменной VLM предлагается Cotype Light 3 с vLLM и MTP. Тесты проводились на общей NVIDIA A100 80GB с batch=1 и 15 образцами русского рукописного текста, с едиными настройками, такими как точность bfloat16, температура 0.0 и конкретные подсказки.