Ray

नवीनतम AI समाचार, मॉडल और रिलीज़ Ray. ['Ray Serve']

एन्कोडर गार्ड मॉडल के इन्फेरेंस को तेज़ करना: TensorRT, Triton, vLLM, Ray Serve

यह लेख एक ज़ीरो-शॉट PII-एन्कोडर गार्ड मॉडल को तेज़ करने के लिए उपकरणों की तुलना करता है, जो LLM ऐप के इनपुट और आउटपुट की जाँच करता है। लेखक TensorRT, NVIDIA Triton, vLLM, Ray Serve, और एक Flash DeBERTa बैकबोन का परीक्षण करता है, जिसमें RPS और लेटेंसी मापी जाती है। TensorRT FP16 PyTorch FP16 की तुलना में 23% का सुधार देता है, लेकिन कस्टम ऑपरेशनों के कारण INT8 क्वांटाइज़ेशन विफल हो जाता है।

NVIDIANVIDIA vLLMvLLM RayRay
Habr — хаб ML05.08 · 15:03
ताज़ा समाचार