Деградация инференса LLM в продакшене: KV-кэш, OOM и хвост p99
Продакшен-инференс LLM часто деградирует постепенно из-за фрагментации KV-кэша, OOM при длинных контекстах, блокировки головы очереди и скачков задержки на уровне p99. Евангелист VK Cloud Стас Погоржельский объясняет четыре механизма, вызывающих снижение производительности, и предлагает сценарии воспроизведения и метрики для выявления проблем до инцидентов.
Евангелист технологий VK Cloud Стас Погоржельский объясняет, что деградация LLM-инференса в производстве обычно происходит постепенно, а не приводит к мгновенному отказу. Он выделяет четыре ключевых механизма: фрагментация KV-кэша, приводящая к потере 60-80% памяти, нехватка памяти (OOM) на длинных контекстах, блокировка начала очереди (head-of-line blocking) в батчах и расхождение метрик
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
