تسريع استدلال نموذج حارس الترميز: TensorRT وTriton وvLLM وRay Serve
تقارن المقالة الأدوات المستخدمة لتسريع نموذج حارس ترميز PII ذو الصفر-shot والذي يتحقق من مدخلات ومخرجات تطبيق LLM. يختبر المؤلف TensorRT وNVIDIA Triton وvLLM وRay Serve وبنية Flash DeBERTa، ويقيس معدل الطلبات في الثانية وزمن الاستجابة. يوفر TensorRT FP16 تحسينًا بنسبة 23% مقارنةً بـPyTorch FP16، لكن تفشل كمية INT8 بسبب العمليات المخصصة.
NVIDIA
vLLM
Ray
Habr — хаб ML05.08 · 15:03
