FasterTransformer

최신 AI 뉴스, 모델 및 출시 정보 FasterTransformer.

프로덕션에서의 LLM 추론 성능 저하: KV-캐시, OOM, 그리고 p99 꼬리 지연

프로덕션 LLM 추론은 KV-캐시 단편화, 긴 컨텍스트에서의 OOM(메모리 부족), 헤드오브라인 차단, 그리고 p99 지연 시간 급증 등으로 인해 점진적으로 성능이 저하되는 경우가 많습니다. VK Cloud의 전도사인 Stas Pogorzhelsky는 성능 저하를 일으키는 네 가지 메커니즘을 설명하고, 장애 발생 전에 문제를 감지할 수 있는 재현 스크립트와 지표를 제공합니다.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
새로운 뉴스