エンコーダーガードモデルの推論高速化:TensorRT、Triton、vLLM、Ray Serve
本記事では、LLMアプリの入力と出力をチェックするゼロショットPIIエンコーダーガードモデルの高速化ツールを比較します。著者はTensorRT、NVIDIA Triton、vLLM、Ray Serve、およびFlash DeBERTaバックボーンをテストし、RPSとレイテンシを測定します。TensorRT FP16はPyTorch FP16と比較して23%の向上を示しますが、INT8量子化はカスタム操作のために失敗します。
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
