本番環境におけるLLM推論の劣化:KVキャッシュ、OOM、p99テールレイテンシ
本番環境でのLLM推論は、KVキャッシュの断片化、長いコンテキストでのOOM、ヘッドオブラインブロッキング(先頭ブロッキング)、p99レイテンシのスパイクなどにより、徐々に劣化することがよくあります。VK CloudのエバンジェリストであるStas Pogorzhelsky氏は、性能低下を引き起こす4つのメカニズムを説明し、インシデント発生前に問題を検出するための再現スクリプトとメトリクスを提供しています。
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
