Ускорение инференса модели-стража энкодера: TensorRT, Triton, vLLM, Ray Serve
В статье сравниваются инструменты для ускорения модели-стража энкодера zero-shot PII, которая проверяет входные и выходные данные приложения на основе LLM. Автор тестирует TensorRT, NVIDIA Triton, vLLM, Ray Serve и бэкбон Flash DeBERTa, измеряя пропускную способность (RPS) и задержку. TensorRT FP16 дает прирост на 23% по сравнению с PyTorch FP16, но INT8-квантизация не работает из-за пользовательских операций.
Habr — хаб ML05.08 · 15:03
