Text Generation Inference (TGI)

Tin tức, mô hình và bản phát hành AI mới nhất từ Text Generation Inference (TGI).

Suy giảm hiệu năng suy luận LLM trong sản xuất: KV-cache, hết bộ nhớ và độ trễ phân vị thứ 99

Suy luận LLM trong sản xuất thường suy giảm dần do phân mảnh KV-cache, hết bộ nhớ (OOM - Out Of Memory) với ngữ cảnh dài, tắc nghẽn đầu hàng và các đỉnh độ trễ phân vị thứ 99 (p99). Chuyên gia truyền bá của VK Cloud Stas Pogorzhelsky giải thích bốn cơ chế gây ra suy giảm hiệu năng và cung cấp các kịch bản tái hiện cùng số liệu để phát hiện sự cố trước khi chúng xảy ra.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Tin mới