프로덕션에서의 LLM 추론 성능 저하: KV-캐시, OOM, 그리고 p99 꼬리 지연
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
프로덕션 LLM 추론은 KV-캐시 단편화, 긴 컨텍스트에서의 OOM(메모리 부족), 헤드오브라인 차단, 그리고 p99 지연 시간 급증 등으로 인해 점진적으로 성능이 저하되는 경우가 많습니다. VK Cloud의 전도사인 Stas Pogorzhelsky는 성능 저하를 일으키는 네 가지 메커니즘을 설명하고, 장애 발생 전에 문제를 감지할 수 있는 재현 스크립트와 지표를 제공합니다.
VK Cloud 기술 전도사인 Stas Pogorzhelsky는 프로덕션 LLM 추론이 일반적으로 즉시 실패하기보다는 점진적으로 성능이 저하된다고 설명합니다. 그는 네 가지 주요 메커니즘을 식별합니다: KV-캐시 단편화로 인한 60-80% 메모리 손실, 긴 컨텍스트에서의 OOM(메모리 부족), 배치에서의 HOL(Head-of-Line) 블로킹, 그리고 p50/p99 지표의 분기입니다. 이 기사는 문제가 발생하기 전에 문제를 포착하기 위한 재현 스크립트와 지표를 제공합니다. 프로덕션 환경에서 KV-캐시가 모델 가중치보다 더 많은 메모리를 차지하는 경우가 많다는 점을 강조합니다. PagedAttention은 단편화를 4% 미만으로 줄이고 처리량을 2~4배 향상시키지만, 시간이 지남에 따라 외부 단편화와 축출이 여전히 문제를 일으킬 수 있습니다. 연속 배치(Continuous Batching)는 긴 프리필 요청이 짧은 요청을 지연시킬 때 HOL(Head-of-Line) 블로킹을 유발할 수 있으며, 청크 프리필(Chunked Prefill)이 이를 완화합니다. KV-캐시에 FP8 양자화를 적용하면 FP16 대비 실질 메모리 용량이 거의 두 배로 늘어납니다. OOM을 기다리기보다는 캐시 사용량 및 최대 KV 값의 추세를 모니터링하는 것이 좋습니다.
출처: Habr — хаб ИИ —
원문
