Beschleunigung der Inferenz eines Encoder-Guard-Modells: TensorRT, Triton, vLLM, Ray Serve
Der Artikel vergleicht Werkzeuge zur Beschleunigung eines Zero-Shot-PII-Encoder-Guard-Modells, das die Eingabe und Ausgabe einer LLM-Anwendung prüft. Der Autor testet TensorRT, NVIDIA Triton, vLLM, Ray Serve und ein Flash-DeBERTa-Backbone und misst RPS (Requests pro Sekunde) und Latenz. TensorRT FP16 bietet eine Verbesserung von 23 Prozent gegenüber PyTorch FP16, aber die INT8-Quantisierung scheitert aufgrund benutzerdefinierter Operationen.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
