Text Generation Inference (TGI)

Последние новости ИИ, модели и релизы от Text Generation Inference (TGI).

Деградация инференса LLM в продакшене: KV-кэш, OOM и хвост p99

Продакшен-инференс LLM часто деградирует постепенно из-за фрагментации KV-кэша, OOM при длинных контекстах, блокировки головы очереди и скачков задержки на уровне p99. Евангелист VK Cloud Стас Погоржельский объясняет четыре механизма, вызывающих снижение производительности, и предлагает сценарии воспроизведения и метрики для выявления проблем до инцидентов.

vLLM Meta NVIDIA Hugging Face Anyscale Ray Serve Text Generation Inference (TGI) FasterTransformer
Habr — хаб ИИ05.08 · 04:04
Свежие новости