RisetSumber Terbuka 🇺🇸 10.08.2026 14:02

Membuat Distilasi Pengetahuan Cukup Murah untuk Dijalankan dalam Skala Besar

Multiverse ComputingMultiverse Computing NVIDIANVIDIA MetaMeta
Sebuah makalah baru dari Multiverse Computing memperkenalkan distilasi pengetahuan offline yang efisien dengan logit top-K yang di-cache dan kerugian KL (Kullback-Leibler) terfusi dan terpotong, mengurangi penggunaan VRAM lebih dari 15 kali lipat dan memungkinkan distilasi konteks panjang pada satu GPU. Teknik-teknik ini secara signifikan memangkas biaya pelatihan, membuat eksperimen distilasi skala besar menjadi praktis.
Distilasi pengetahuan, di mana model siswa yang lebih kecil belajar untuk meniru model guru yang lebih besar, adalah teknik standar untuk mengompresi model bahasa besar. Model sumber terbuka (open-source) LLM terbaru seperti Kimi-K3 dengan 2,8 triliun parameter membutuhkan sekitar 3TB VRAM, sehingga kompresi menjadi penting. Makalah 'Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss' mengatasi biaya distilasi yang tinggi dengan menyimpan logits top-K dari guru secara offline, sehingga tidak perlu menyimpan guru dalam memori. Makalah ini juga memperkenalkan fused chunked KL loss yang menghitung kerugian dalam potongan-potongan, menghindari matriks vocab×sequence yang penuh. Ini mengurangi VRAM puncak dari 250GB menjadi 128GB pada satu H200, memungkinkan distilasi pada konteks 32K dengan satu GPU, bukan empat node, dengan waktu langkah 5x lebih cepat. Model siswa, yang didistilasi dari Llama 3.1 8B Instruct menjadi 3.2B parameter, mempertahankan sebagian besar akurasi pada tolok ukur seperti BoolQ dan HellaSwag dan tetap dalam sembilan poin pada MMLU.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru