Многоуровневый KV-кэш для больших LLM на Amazon SageMaker HyperPod с Curvine
В этом посте описывается многоуровневая архитектура KV-кэша на Amazon SageMaker HyperPod, расширяющая иерархию кэша от GPU до CPU и общего пула NVMe с помощью Curvine — распределенной кэширующей файловой системы. Это позволяет повторно использовать KV-кэш между репликами, достигая до 100% попаданий в кэш между подами и до 2,7-кратного улучшения TTFT. Решение снижает инфраструктурные затраты, позволяя запускать рабочие нагрузки на более дешевых инстансах G6e вместо P5.
При масштабном инференсе больших языковых моделей (БЯМ, англ. Large Language Model — LLM) обычно приходится идти на компромисс, связанный с KV-кэшем (кэшем ключей и значений): либо платить за избыточно мощные инстансы с графическими процессорами (GPU), чтобы вместить постоянно растущий KV-кэш, либо мириться с большим временем до первого токена (Time To First Token — TTFT), поскольку идентичные
Показать ещё ↓
Источник: AWS ML blog —
оригинал
