Ray

Laatste AI-nieuws, modellen en releases van Ray. ['Ray Serve']

Het versnellen van inferentie van een encoder-guardmodel: TensorRT, Triton, vLLM, Ray Serve

Het artikel vergelijkt tools voor het versnellen van een zero-shot PII-encoder-guardmodel dat de invoer en uitvoer van een LLM-app controleert. De auteur test TensorRT, NVIDIA Triton, vLLM, Ray Serve en een Flash DeBERTa-backbone, en meet RPS en latentie. TensorRT FP16 geeft een verbetering van 23% ten opzichte van PyTorch FP16, maar INT8-kwantificatie faalt vanwege aangepaste operaties.

NVIDIANVIDIA vLLMvLLM RayRay
Habr — хаб ML05.08 · 15:03
Vers nieuws