Hardware e InferênciaPesquisa 🇷🇺 05.08.2026 15:03

Acelerando a inferência de um modelo guard de codificador: TensorRT, Triton, vLLM, Ray Serve

NVIDIANVIDIA vLLMvLLM RayRay
O artigo compara ferramentas para acelerar um modelo guard de codificador PII zero-shot que verifica a entrada e a saída de um aplicativo de LLM. O autor testa TensorRT, NVIDIA Triton, vLLM, Ray Serve e um backbone Flash DeBERTa, medindo RPS e latência. TensorRT FP16 proporciona um ganho de 23% sobre PyTorch FP16, mas a quantização INT8 falha devido a operações customizadas.
O artigo descreve uma tentativa de acelerar um modelo de guarda que fica entre um LLM e o usuário, verificando conteúdo perigoso. O modelo é um codificador PII de zero disparo: ele recebe os tipos de entidade como entrada de texto junto com o documento, extraindo entidades e classificando a segurança em uma única passagem direta. Devido à sua arquitetura, ele impõe sete restrições de engenharia: formato de entrada variável, saída não tensorial que requer decodificação de span na CPU, operações específicas como gather e pontuação bilinear, atenção potencialmente não padrão, custo do lote determinado pelo elemento mais longo, infraestrutura de serviço otimizada para LLMs autorregressivos e a importância da latência de cauda (P95, P99) porque a guarda é chamada duas vezes por turno de diálogo. O experimento compara cinco ferramentas: runtime TensorRT, NVIDIA Triton, vLLM, Ray Serve e um backbone Flash DeBERTa, com baselines usando LitServe. A pista de runtime com TensorRT usou um perfil de carga curto (um worker, 50 usuários, 60 segundos), enquanto as pistas de serviço usaram um perfil mais longo (quatro workers, 100 usuários, 15 minutos), então os números são comparáveis apenas dentro de cada pista. A variante TensorRT FP16 atinge 130,72 RPS versus 106,49 RPS para PyTorch FP16, uma melhoria de 23%. As tentativas de quantização INT8 falharam devido à falta de suporte para operações personalizadas, resultando em RPS muito baixo e alta latência.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas