本番環境におけるLLM推論の劣化:KVキャッシュ、OOM、p99テールレイテンシ
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
本番環境でのLLM推論は、KVキャッシュの断片化、長いコンテキストでのOOM、ヘッドオブラインブロッキング(先頭ブロッキング)、p99レイテンシのスパイクなどにより、徐々に劣化することがよくあります。VK CloudのエバンジェリストであるStas Pogorzhelsky氏は、性能低下を引き起こす4つのメカニズムを説明し、インシデント発生前に問題を検出するための再現スクリプトとメトリクスを提供しています。
VK Cloudのテクノロジーエバンジェリスト、Stas Pogorzhelsky氏は、本番環境のLLM推論は通常、即座に失敗するのではなく、徐々に劣化することを説明しています。彼は4つの主要なメカニズムを挙げています:KVキャッシュの断片化によるメモリ損失60〜80%、長いコンテキストでのOOM、バッチ内の先頭ブロッキング、p50/p99メトリクスの乖離です。この記事では、問題がインシデントになる前に検出するための再現スクリプトとメトリクスを提供しています。本番環境では、KVキャッシュがモデルの重みを超えることが多いことを強調しています。PagedAttentionは断片化を4%未満に減らし、スループットを2〜4倍向上させますが、外部断片化とエビクションは時間の経過とともに問題を引き起こします。連続バッチ処理では、長いプリフィル要求が短い要求を遅延させると先頭ブロッキングが発生する可能性がありますが、チャンク化プリフィルはこれを軽減します。KVキャッシュのFP8量子化は、FP16と比較して実効メモリ容量をほぼ2倍にします。OOMを待つのではなく、キャッシュ使用量とピークKVの傾向を監視することを推奨しています。
出典: Habr — хаб ИИ —
原文
