Руководство по выживанию с KV-кэшем: почему ваша видеокарта не справляется с памятью при работе с локальными LLM
В статье объясняется, почему видеокарты не справляются с памятью при запуске локальных LLM (больших языковых моделей), и виновником оказывается KV-кэш. Предлагается руководство по выживанию с методами управления использованием памяти.
Статья объясняет, что запуск локальных больших языковых моделей (LLM) может привести к нехватке памяти на графических процессорах, при этом основным фактором является кэш ключ-значение (KV). В ней описывается, как KV-кэш хранит промежуточные значения внимания, которые линейно растут с длиной последовательности и размером пакета, что приводит к значительному потреблению памяти. В руководстве
Показать ещё ↓
Источник: Meta AI (GNews) —
оригинал
