Ray

En son yapay zeka haberleri, modeller ve sürümler Ray. ['Ray Serve']

Bir kodlayıcı koruma modelinin çıkarımını hızlandırma: TensorRT, Triton, vLLM, Ray Serve

Makale, bir LLM uygulamasının girdi ve çıktısını kontrol eden sıfır atışlı PII kodlayıcı koruma modelini hızlandırmak için kullanılan araçları karşılaştırıyor. Yazar TensorRT, NVIDIA Triton, vLLM, Ray Serve ve Flash DeBERTa omurgasını test ederek RPS ve gecikmeyi ölçüyor. TensorRT FP16, PyTorch FP16'ya göre %23 iyileşme sağlıyor ancak özel işlemler nedeniyle INT8 niceleme başarısız oluyor.

NVIDIANVIDIA vLLMvLLM RayRay
Habr — хаб ML05.08 · 15:03
Güncel haberler