एन्कोडर गार्ड मॉडल के इन्फेरेंस को तेज़ करना: TensorRT, Triton, vLLM, Ray Serve
यह लेख एक ज़ीरो-शॉट PII-एन्कोडर गार्ड मॉडल को तेज़ करने के लिए उपकरणों की तुलना करता है, जो LLM ऐप के इनपुट और आउटपुट की जाँच करता है। लेखक TensorRT, NVIDIA Triton, vLLM, Ray Serve, और एक Flash DeBERTa बैकबोन का परीक्षण करता है, जिसमें RPS और लेटेंसी मापी जाती है। TensorRT FP16 PyTorch FP16 की तुलना में 23% का सुधार देता है, लेकिन कस्टम ऑपरेशनों के कारण INT8 क्वांटाइज़ेशन विफल हो जाता है।
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
