Acelerando a inferência de um modelo guard de codificador: TensorRT, Triton, vLLM, Ray Serve
O artigo compara ferramentas para acelerar um modelo guard de codificador PII zero-shot que verifica a entrada e a saída de um aplicativo de LLM. O autor testa TensorRT, NVIDIA Triton, vLLM, Ray Serve e um backbone Flash DeBERTa, medindo RPS e latência. TensorRT FP16 proporciona um ganho de 23% sobre PyTorch FP16, mas a quantização INT8 falha devido a operações customizadas.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
