Mempercepat Inferensi Model Penjaga Encoder: TensorRT, Triton, vLLM, Ray Serve
Artikel ini membandingkan alat-alat untuk mempercepat model penjaga encoder PII zero-shot yang memeriksa input dan output aplikasi LLM. Penulis menguji TensorRT, NVIDIA Triton, vLLM, Ray Serve, dan backbone Flash DeBERTa, mengukur RPS dan latensi. TensorRT FP16 memberikan peningkatan 23 persen dibandingkan PyTorch FP16, tetapi kuantisasi INT8 gagal karena operasi kustom.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
