La guía de supervivencia para la caché KV: por qué tu GPU se queda sin memoria con los LLM locales
Meta
El artículo explica por qué las GPU se quedan sin memoria al ejecutar LLM locales, centrándose en la caché KV como la culpable. Ofrece una guía de supervivencia con técnicas para gestionar el uso de memoria.
El artículo explica que ejecutar modelos de lenguaje grandes (LLM) locales puede hacer que las GPU se queden sin memoria, siendo la caché de clave-valor (KV) un factor importante. Describe cómo la caché KV almacena valores de atención intermedios, creciendo linealmente con la longitud de la secuencia y el tamaño del lote, consumiendo así una memoria significativa. La guía ofrece estrategias como la cuantización, el uso de atención flash y optar por modelos más pequeños o usar descarga a CPU. Destaca los compromisos entre el ahorro de memoria y la velocidad o la calidad.
Fuente: Meta AI (GNews) —
original
