Ray

Tin tức, mô hình và bản phát hành AI mới nhất từ Ray. ['Ray Serve']

Tăng tốc suy luận của một mô hình bảo vệ encoder: TensorRT, Triton, vLLM, Ray Serve

Bài viết so sánh các công cụ để tăng tốc một mô hình bảo vệ encoder zero-shot cho việc kiểm tra đầu vào và đầu ra của một ứng dụng LLM. Tác giả thử nghiệm TensorRT, NVIDIA Triton, vLLM, Ray Serve và một bộ xương Flash DeBERTa, đo RPS và độ trễ. TensorRT FP16 mang lại cải thiện 23% so với PyTorch FP16, nhưng lượng tử hóa INT8 thất bại do các phép toán tùy chỉnh.

NVIDIANVIDIA vLLMvLLM RayRay
Habr — хаб ML05.08 · 15:03
Tin mới