LLM-päätelmän suorituskyvyn heikkeneminen tuotannossa: KV-välimuisti, muistin loppuminen ja p99-hännän viive
LLM-päätelmä tuotannossa heikkenee usein asteittain johtuen KV-välimuistin pirstoutumisesta, muistin loppumisesta pitkissä konteksteissa, jonon alkupään tukkeutumisesta ja p99-viivepiikeistä. VK Cloudin evankelista Stas Pogorzhelsky selittää neljä mekanismia, jotka aiheuttavat suorituskyvyn heikkenemistä, ja tarjoaa toistettavuusskriptejä sekä mittareita ongelmien havaitsemiseksi ennen häiriöitä.
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
Habr — хаб ИИ05.08 · 04:04
