Ray

أحدث أخبار ونماذج وإصدارات الذكاء الاصطناعي من Ray. ['Ray Serve']

تسريع استدلال نموذج حارس الترميز: TensorRT وTriton وvLLM وRay Serve

تقارن المقالة الأدوات المستخدمة لتسريع نموذج حارس ترميز PII ذو الصفر-shot والذي يتحقق من مدخلات ومخرجات تطبيق LLM. يختبر المؤلف TensorRT وNVIDIA Triton وvLLM وRay Serve وبنية Flash DeBERTa، ويقيس معدل الطلبات في الثانية وزمن الاستجابة. يوفر TensorRT FP16 تحسينًا بنسبة 23% مقارنةً بـPyTorch FP16، لكن تفشل كمية INT8 بسبب العمليات المخصصة.

NVIDIANVIDIA vLLMvLLM RayRay
Habr — хаб ML05.08 · 15:03
أخبار جديدة