De KV-cache-overlevingsgids: waarom je GPU zonder geheugen komt te zitten bij lokale LLM's
Meta
Het artikel legt uit waarom GPU's zonder geheugen komen te zitten bij het draaien van lokale LLM's, met de KV-cache als boosdoener. Het biedt een overlevingsgids met technieken om het geheugengebruik te beheren.
Het artikel legt uit dat het lokaal draaien van grote taalmodellen (large language models, LLM's) kan leiden tot een tekort aan GPU-geheugen, waarbij de key-value (KV) cache een grote bijdrager is. Het beschrijft hoe de KV-cache tussenliggende aandachtswaarden opslaat, die lineair groeien met de sequentielengte en batchgrootte, en dus aanzienlijk geheugen verbruikt. De gids biedt strategieën zoals kwantisering, het gebruik van flash attention, en het kiezen voor kleinere modellen of het gebruik van CPU-offloading. Het benadrukt de afwegingen tussen geheugenbesparing en snelheid of kwaliteit.
Bron: Meta AI (GNews) —
origineel
