RechercheOpen Source 🇺🇸 10.08.2026 14:02

Rendre la distillation des connaissances suffisamment économique pour fonctionner à grande échelle

Multiverse ComputingMultiverse Computing NVIDIANVIDIA MetaMeta
Un nouvel article de Multiverse Computing présente une distillation des connaissances hors ligne efficace, utilisant des logits top-K mis en cache et une perte de divergence de Kullback-Leibler (KL) fusionnée par blocs, ce qui réduit l'utilisation de la mémoire vidéo (VRAM) de plus de quinze fois et permet une distillation sur de longs contextes avec un seul processeur graphique (GPU). Ces techniques réduisent considérablement les coûts d'entraînement, rendant pratiques les expériences de distillation à grande échelle.
La distillation des connaissances, où un modèle étudiant plus petit apprend à imiter un modèle enseignant plus grand, est une technique standard pour compresser les grands modèles de langage. Les LLM open source récents comme Kimi-K3 avec 2,8 billions de paramètres nécessitent environ 3 To de mémoire VRAM, ce qui rend la compression essentielle. L'article « Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss » aborde les coûts élevés de la distillation en mettant en cache les logits top-K de l'enseignant hors ligne, éliminant ainsi la nécessité de garder l'enseignant en mémoire. Il introduit également une perte KL par blocs fusionnée qui calcule la perte par blocs, évitant la matrice complète vocabulaire×séquence. Cela réduit la mémoire VRAM de pointe de 250 Go à 128 Go sur un seul H200, permettant une distillation à un contexte de 32K sur une seule GPU au lieu de quatre nœuds, avec des temps d'étape 5 fois plus rapides. Le modèle étudiant, distillé de Llama 3.1 8B Instruct à 3,2 milliards de paramètres, conserve la plupart de la précision sur des benchmarks comme BoolQ et HellaSwag et reste à moins de neuf points sur MMLU.
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches