Ray

Uusimmat tekoälyuutiset, mallit ja julkaisut taholta Ray. ['Ray Serve']

Inferenssin nopeuttaminen encoder-suojamallissa: TensorRT, Triton, vLLM, Ray Serve

Artikkelissa verrataan työkaluja zero-shot-tyyppisen PII-encoder-suojamallin nopeuttamiseen, joka tarkistaa LLM-sovelluksen syötteen ja lähdön. Kirjoittaja testaa TensorRT:tä, NVIDIA Tritonia, vLLM:ää, Ray Serveä ja Flash DeBERTa -selkärankaa ja mittaa RPS:ää ja viivettä. TensorRT FP16 antaa 23 prosentin parannuksen PyTorch FP16:een verrattuna, mutta INT8-kvantisointi epäonnistuu mukautettujen operaatioiden vuoksi.

NVIDIANVIDIA vLLMvLLM RayRay
Habr — хаб ML05.08 · 15:03
Tuoreet uutiset