Inferenssin nopeuttaminen encoder-suojamallissa: TensorRT, Triton, vLLM, Ray Serve
Artikkelissa verrataan työkaluja zero-shot-tyyppisen PII-encoder-suojamallin nopeuttamiseen, joka tarkistaa LLM-sovelluksen syötteen ja lähdön. Kirjoittaja testaa TensorRT:tä, NVIDIA Tritonia, vLLM:ää, Ray Serveä ja Flash DeBERTa -selkärankaa ja mittaa RPS:ää ja viivettä. TensorRT FP16 antaa 23 prosentin parannuksen PyTorch FP16:een verrattuna, mutta INT8-kvantisointi epäonnistuu mukautettujen operaatioiden vuoksi.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
