Ускорение инференса модели-стража энкодера: TensorRT, Triton, vLLM, Ray Serve
В статье сравниваются инструменты для ускорения модели-стража энкодера zero-shot PII, которая проверяет входные и выходные данные приложения на основе LLM. Автор тестирует TensorRT, NVIDIA Triton, vLLM, Ray Serve и бэкбон Flash DeBERTa, измеряя пропускную способность (RPS) и задержку. TensorRT FP16 дает прирост на 23% по сравнению с PyTorch FP16, но INT8-квантизация не работает из-за пользовательских операций.
Статья описывает попытку ускорить guard-модель, которая располагается между LLM и пользователем и проверяет контент на опасность. Модель представляет собой zero-shot PII-энкодер: она принимает типы сущностей в виде текста вместе с документом, извлекая сущности и классифицируя безопасность за один прямой проход. Из-за своей архитектуры она накладывает семь инженерных ограничений: переменная форма
Показать ещё ↓
Источник: Habr — хаб ML —
оригинал
