Het versnellen van inferentie van een encoder-guardmodel: TensorRT, Triton, vLLM, Ray Serve
Het artikel vergelijkt tools voor het versnellen van een zero-shot PII-encoder-guardmodel dat de invoer en uitvoer van een LLM-app controleert. De auteur test TensorRT, NVIDIA Triton, vLLM, Ray Serve en een Flash DeBERTa-backbone, en meet RPS en latentie. TensorRT FP16 geeft een verbetering van 23% ten opzichte van PyTorch FP16, maar INT8-kwantificatie faalt vanwege aangepaste operaties.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
