Bir kodlayıcı koruma modelinin çıkarımını hızlandırma: TensorRT, Triton, vLLM, Ray Serve
Makale, bir LLM uygulamasının girdi ve çıktısını kontrol eden sıfır atışlı PII kodlayıcı koruma modelini hızlandırmak için kullanılan araçları karşılaştırıyor. Yazar TensorRT, NVIDIA Triton, vLLM, Ray Serve ve Flash DeBERTa omurgasını test ederek RPS ve gecikmeyi ölçüyor. TensorRT FP16, PyTorch FP16'ya göre %23 iyileşme sağlıyor ancak özel işlemler nedeniyle INT8 niceleme başarısız oluyor.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
