Bir kodlayıcı koruma modelinin çıkarımını hızlandırma: TensorRT, Triton, vLLM, Ray Serve
NVIDIA
vLLM
Ray
Makale, bir LLM uygulamasının girdi ve çıktısını kontrol eden sıfır atışlı PII kodlayıcı koruma modelini hızlandırmak için kullanılan araçları karşılaştırıyor. Yazar TensorRT, NVIDIA Triton, vLLM, Ray Serve ve Flash DeBERTa omurgasını test ederek RPS ve gecikmeyi ölçüyor. TensorRT FP16, PyTorch FP16'ya göre %23 iyileşme sağlıyor ancak özel işlemler nedeniyle INT8 niceleme başarısız oluyor.
Makale, bir LLM ile kullanıcı arasında yer alan ve tehlikeli içerikleri kontrol eden bir koruma modelini hızlandırma girişimini anlatıyor. Model, sıfır atışlı (zero-shot) bir KİK (Kişisel Kimlik Bilgisi) kodlayıcıdır: varlık türlerini metin girişi olarak belgeyle birlikte alır, varlıkları çıkarır ve güvenliği tek bir ileri geçişte sınıflandırır. Mimarisi nedeniyle yedi mühendislik kısıtı ortaya koyar: değişken girdi şekli, tensör olmayan çıktı (CPU'da span kod çözme gerektirir), toplama (gather) ve çift doğrusal (bilinear) puanlama gibi belirli işlemler, potansiyel olarak standart dışı dikkat, toplu işlem maliyetinin en uzun öğeye göre belirlenmesi, otoregresif LLM'ler için optimize edilmiş sunum altyapısı ve kuyruk gecikmesinin (P95, P99) önemi çünkü koruma modeli her diyalog turunda iki kez çağrılır. Deney, beş aracı karşılaştırıyor: TensorRT çalışma zamanı, NVIDIA Triton, vLLM, Ray Serve ve Flash DeBERTa omurgası; temel olarak LitServe kullanılıyor. TensorRT ile çalışma zamanı parkuru kısa bir yük profili kullandı (bir çalışan, 50 kullanıcı, 60 saniye), sunum parkurları ise daha uzun bir profil kullandı (dört çalışan, 100 kullanıcı, 15 dakika), bu nedenle sayılar yalnızca kendi parkurları içinde karşılaştırılabilir. TensorRT FP16 varyantı, PyTorch FP16'nın saniyede 106,49 isteğine karşılık saniyede 130,72 istek elde ediyor; bu %23'lük bir iyileşme. INT8 niceleme girişimleri, özel işlemlere destek olmaması nedeniyle başarısız oldu ve çok düşük saniye başına istek sayısına ve yüksek gecikmeye yol açtı.
Kaynak: Habr — хаб ML —
orijinal
