Nghiên cứuMã nguồn mở 🇺🇸 10.08.2026 14:02

Làm cho Quá trình Chưng cất Kiến thức Đủ Rẻ để Chạy ở Quy mô Lớn

Multiverse ComputingMultiverse Computing NVIDIANVIDIA MetaMeta
Một bài báo mới từ Multiverse Computing giới thiệu phương pháp chưng cất kiến thức ngoại tuyến hiệu quả với logits top-K được lưu trong bộ nhớ đệm và hàm mất mát KL theo khối kết hợp, giảm sử dụng bộ nhớ VRAM hơn 15 lần và cho phép chưng cất ngữ cảnh dài trên một GPU duy nhất. Các kỹ thuật này cắt giảm chi phí đào tạo đáng kể, làm cho các thí nghiệm chưng cất quy mô lớn trở nên thiết thực.
Knowledge distillation (chưng cất tri thức) — kỹ thuật trong đó một mô hình học sinh (student model) nhỏ hơn học cách mô phỏng một mô hình giáo viên (teacher model) lớn hơn — là phương pháp tiêu chuẩn để nén các mô hình ngôn ngữ lớn (LLM - Large Language Model). Các LLM mã nguồn mở gần đây như Kimi-K3 với 2,8 nghìn tỷ tham số đòi hỏi khoảng 3TB VRAM, khiến việc nén trở nên thiết yếu. Bài báo 'Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss' giải quyết chi phí cao của quá trình chưng cất bằng cách lưu cache offline các logit top-K của mô hình giáo viên, loại bỏ nhu cầu phải giữ mô hình giáo viên trong bộ nhớ. Bài báo cũng giới thiệu một hàm mất mát KL (Kullback-Leibler) hợp nhất theo từng khối (fused chunked KL loss), tính toán giá trị mất mát theo từng phần nhỏ, tránh phải xử lý toàn bộ ma trận từ vựng×chuỗi. Cách tiếp cận này giúp giảm VRAM đỉnh từ 250GB xuống còn 128GB trên một GPU H200 duy nhất, cho phép thực hiện chưng cất ở ngữ cảnh 32K trên một GPU thay vì bốn node, với tốc độ mỗi bước nhanh hơn 5 lần. Mô hình học sinh, được chưng cất từ Llama 3.1 8B Instruct xuống còn 3,2 tỷ tham số, vẫn giữ được phần lớn độ chính xác trên các bộ đánh giá như BoolQ và HellaSwag, và chỉ chênh lệch trong khoảng chín điểm trên MMLU (Massive Multitask Language Understanding).
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới