하드웨어 및 추론연구 🇷🇺 05.08.2026 15:03

인코더 가드 모델 추론 가속화: TensorRT, Triton, vLLM, Ray Serve

NVIDIANVIDIA vLLMvLLM RayRay
이 기사는 LLM 앱의 입력과 출력을 검사하는 제로샷 PII 인코더 가드 모델을 가속화하기 위한 도구들을 비교합니다. 저자는 TensorRT, NVIDIA Triton, vLLM, Ray Serve, 그리고 Flash DeBERTa 백본을 테스트하며 RPS와 지연 시간을 측정합니다. TensorRT FP16은 PyTorch FP16 대비 23% 향상을 보여주지만, INT8 양자화는 사용자 정의 연산으로 인해 실패합니다.
이 기사는 LLM과 사용자 사이에 위치하여 위험한 콘텐츠를 검사하는 가드 모델을 가속화하려는 시도에 대해 설명합니다. 이 모델은 제로샷 PII 인코더로, 엔터티 유형을 텍스트 입력으로 받아 문서와 함께 처리하고, 엔터티를 추출하고 안전성을 하나의 순방향 패스에서 분류합니다. 아키텍처 특성상 일곱 가지 엔지니어링 제약 조건이 있습니다: 가변 입력 형태, 텐서가 아닌 출력으로 CPU 스팬 디코딩 필요, gather 및 bilinear scoring과 같은 특정 연산, 잠재적으로 비표준 어텐션, 가장 긴 요소에 의해 결정되는 배치 비용, 자기회귀 LLM에 최적화된 서빙 인프라, 그리고 대화 턴당 가드가 두 번 호출되기 때문에 꼬리 지연 시간(P95, P99)의 중요성입니다. 실험은 TensorRT 런타임, NVIDIA Triton, vLLM, Ray Serve, Flash DeBERTa 백본 등 다섯 가지 도구를 비교하며, 기준선으로 LitServe를 사용합니다. TensorRT를 사용한 런타임 트랙은 짧은 부하 프로필(워커 1개, 사용자 50명, 60초)을 사용했고, 서빙 트랙은 더 긴 프로필(워커 4개, 사용자 100명, 15분)을 사용했으므로 숫자는 각 트랙 내에서만 비교할 수 있습니다. TensorRT FP16 변형은 초당 130.72 요청(RPS)을 달성하여 PyTorch FP16의 106.49 RPS보다 23% 향상되었습니다. INT8 양자화 시도는 커스텀 연산에 대한 지원 부족으로 실패하여 매우 낮은 RPS와 높은 지연 시간을 초래했습니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스