LLM-päätelmän suorituskyvyn heikkeneminen tuotannossa: KV-välimuisti, muistin loppuminen ja p99-hännän viive
vLLM
Meta
NVIDIA
Hugging Face
Anyscale
Ray Serve
Text Generation Inference (TGI)
FasterTransformer
LLM-päätelmä tuotannossa heikkenee usein asteittain johtuen KV-välimuistin pirstoutumisesta, muistin loppumisesta pitkissä konteksteissa, jonon alkupään tukkeutumisesta ja p99-viivepiikeistä. VK Cloudin evankelista Stas Pogorzhelsky selittää neljä mekanismia, jotka aiheuttavat suorituskyvyn heikkenemistä, ja tarjoaa toistettavuusskriptejä sekä mittareita ongelmien havaitsemiseksi ennen häiriöitä.
VK Cloud -teknologiaevankelista Stas Pogorzhelsky selittää, että tuotannon LLM-päätelmien laatu yleensä heikkenee vähitellen eikä epäonnistu välittömästi. Hän tunnistaa neljä keskeistä mekanismia: KV-välimuistin fragmentoituminen aiheuttaa 60–80 prosentin muistihäviön, muistin loppuminen pitkissä konteksteissa, jonon pään esto erissä sekä p50/p99-mittarien erkaantuminen. Artikkeli tarjoaa toistettavat skriptit ja mittarit ongelmien havaitsemiseksi ennen häiriöitä. Se korostaa, että KV-välimuisti ylittää usein mallin painot tuotannossa. PagedAttention vähentää fragmentoitumista alle 4 prosenttiin ja parantaa suorituskykyä 2–4-kertaiseksi, mutta ulkoinen fragmentoituminen ja poistaminen aiheuttavat silti ongelmia ajan myötä. Jatkuva eräkäsittely voi aiheuttaa jonon pään esto, kun pitkä esitäyttöpyyntö viivästyttää lyhyempiä; paloiteltu esitäyttö lieventää tätä. KV-välimuistin FP8-kvantisointi lähes kaksinkertaistaa tehokkaan muistikapasiteetin verrattuna FP16:een. On suositeltavaa seurata välimuistin käytön ja KV-huipun trendejä sen sijaan, että odotettaisiin muistin loppumista.
Lähde: Habr — хаб ИИ —
Alkuperäinen
