p50/p99. В статье представлены скрипты для воспроизведения и метрики, позволяющие выявить проблемы до возникновения инцидентов. Подчеркивается, что KV-кэш в производстве часто превышает веса модели. PagedAttention снижает фрагментацию до менее чем 4% и увеличивает пропускную способность в 2-4 раза, но внешняя фрагментация и вытеснение со временем все равно вызывают проблемы. Непрерывный батчинг может вызывать блокировку начала очереди, когда длинный запрос на предзаполнение (prefill) задерживает более короткие; чанкованный предзаполнение (chunked prefill) смягчает эту проблему. Квантование KV-кэша в FP8 почти вдвое увеличивает эффективную емкость памяти по сравнению с FP16. Рекомендуется отслеживать тенденции использования кэша и пиковые значения KV, а не ждать OOM.