Panduan Bertahan Hidup KV Cache: Mengapa GPU Anda Kehabisan Memori dengan LLM Lokal
Meta
Artikel ini menjelaskan mengapa GPU kehabisan memori saat menjalankan LLM lokal, dengan fokus pada KV cache sebagai penyebabnya. Artikel ini menawarkan panduan bertahan hidup dengan teknik untuk mengelola penggunaan memori.
Artikel ini menjelaskan bahwa menjalankan model bahasa besar (LLM) secara lokal dapat menyebabkan GPU kehabisan memori, dengan cache key-value (KV) menjadi kontributor utama. Ini menjelaskan bagaimana cache KV menyimpan nilai perhatian antara, yang tumbuh secara linear dengan panjang sekuens dan ukuran batch, sehingga mengonsumsi memori yang signifikan. Panduan ini memberikan strategi seperti kuantisasi, menggunakan flash attention, dan memilih model yang lebih kecil atau menggunakan offloading CPU. Ini menekankan pada trade-off antara penghematan memori dan kecepatan atau kualitas.
Sumber: Meta AI (GNews) —
asli
