нуля происходит только при промахе на всех уровнях кэша, что существенно сокращает TTFT для нагрузок с умеренным или высоким пересечением промптов. На тестовом развёртывании это позволило достичь до 100% попаданий в кэш между подами, ускорения TTFT до 2,7 раза и задержки чтения L2 между узлами около 56 мс для промпта длиной примерно 1 900 токенов. С такой архитектурой нагрузки, ранее требовавшие инстансов P5, могут работать на более дешёвых инстансах G6e, что снижает стоимость каждого эндпоинта. Для реализации требуется SageMaker HyperPod с включённой функцией Tiered Storage, кластер EKS (Elastic Kubernetes Service), а также установка Inference Operator и Curvine. В статье описаны пять этапов: включение Tiered Storage, установка Inference Operator и его зависимостей, установка Curvine, внесение изменений в Inference Operator для поддержки L2 на файловой системе и бенчмаркинг.