Ray Serve

Uusimmat tekoälyuutiset, mallit ja julkaisut taholta Ray Serve.

LLM-päätelmän suorituskyvyn heikkeneminen tuotannossa: KV-välimuisti, muistin loppuminen ja p99-hännän viive

LLM-päätelmä tuotannossa heikkenee usein asteittain johtuen KV-välimuistin pirstoutumisesta, muistin loppumisesta pitkissä konteksteissa, jonon alkupään tukkeutumisesta ja p99-viivepiikeistä. VK Cloudin evankelista Stas Pogorzhelsky selittää neljä mekanismia, jotka aiheuttavat suorituskyvyn heikkenemistä, ja tarjoaa toistettavuusskriptejä sekä mittareita ongelmien havaitsemiseksi ennen häiriöitä.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Tuoreet uutiset