Text Generation Inference (TGI)

Últimas notícias, modelos e lançamentos de IA de Text Generation Inference (TGI).

Degradação de Inferência de LLM em Produção: KV-cache, OOM e a Cauda p99

A inferência de LLM em produção frequentemente degrada gradualmente devido à fragmentação do KV-cache, OOM em contextos longos, bloqueio head-of-line e picos de latência p99. O evangelista da VK Cloud, Stas Pogorzhelsky, explica quatro mecanismos que causam a decadência de desempenho e oferece scripts de reprodução e métricas para detectar problemas antes de incidentes.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Notícias frescas