硬件与推理研究 🇷🇺 05.08.2026 15:03

加速编码器护栏模型推理:TensorRT、Triton、vLLM、Ray Serve 对比

NVIDIANVIDIA vLLMvLLM RayRay
本文比较了加速一个零样本个人身份信息(PII)编码器护栏模型的工具,该模型用于检查大语言模型应用的输入和输出。作者测试了 TensorRT、NVIDIA Triton、vLLM、Ray Serve 以及一个 Flash DeBERTa 骨干网络,测量了每秒请求数(RPS)和延迟。TensorRT FP16 相比 PyTorch FP16 提升了 23% 的性能,但由于自定义操作,INT8 量化未能成功。
文章描述了一次加速防护模型的尝试,该模型位于大语言模型(LLM)与用户之间,负责检查危险内容。该模型是一个零样本的PII编码器:它接受实体类型作为文本输入以及文档,在一次前向传播中提取实体并分类安全性。由于其架构,它带来了七项工程约束:输入形状可变、输出为非张量形式需在CPU上进行跨度解码、需要诸如gather和双线性评分等特定操作、可能非标准的注意力机制、批次成本由最长元素决定、服务于基础设施优化针对自回归LLM,以及尾部延迟(P95、P99)的重要性,因为防护模型每个对话轮次会被调用两次。实验比较了五种工具:TensorRT运行时、NVIDIA Triton、vLLM、Ray Serve以及Flash DeBERTa骨干,并使用LitServe作为基线。TensorRT的运行时测试使用了较短的负载配置(1个工作进程,50个用户,60秒),而服务测试则使用了较长的配置(4个工作进程,100个用户,15分钟),因此数字仅在同一测试内可比。TensorRT FP16变体实现了130.72 RPS,而PyTorch FP16为106.49 RPS,提升了23%。INT8量化尝试失败,因为缺乏对自定义操作的支持,导致RPS非常低且延迟很高。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻