加速编码器护栏模型推理:TensorRT、Triton、vLLM、Ray Serve 对比
本文比较了加速一个零样本个人身份信息(PII)编码器护栏模型的工具,该模型用于检查大语言模型应用的输入和输出。作者测试了 TensorRT、NVIDIA Triton、vLLM、Ray Serve 以及一个 Flash DeBERTa 骨干网络,测量了每秒请求数(RPS)和延迟。TensorRT FP16 相比 PyTorch FP16 提升了 23% 的性能,但由于自定义操作,INT8 量化未能成功。
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
