Tornando a Destilação de Conhecimento Barata o Suficiente para Rodar em Escala
Multiverse Computing
NVIDIA
Meta
Um novo artigo da Multiverse Computing apresenta destilação de conhecimento offline eficiente com logits top-K em cache e uma perda KL (divergência de Kullback-Leibler) fundida por blocos, reduzindo o uso de VRAM em mais de 15 vezes e permitindo destilação de contexto longo em uma única GPU. As técnicas reduzem significativamente os custos de treinamento, tornando experimentos de destilação em larga escala práticos.
A destilação de conhecimento, em que um modelo aluno menor aprende a corresponder a um modelo professor maior, é uma técnica padrão para comprimir grandes modelos de linguagem. Recentes LLMs de código aberto, como o Kimi-K3, com 2,8 trilhões de parâmetros, requerem cerca de 3TB de VRAM, tornando a compressão essencial. O artigo 'Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss' aborda os altos custos da destilação ao armazenar em cache os logits top-K do professor offline, eliminando a necessidade de manter o professor na memória. Ele também introduz uma perda KL em blocos fundidos que calcula a perda em blocos, evitando a matriz completa de vocabulário×sequência. Isso reduz o pico de VRAM de 250GB para 128GB em um único H200, permitindo a destilação em contexto de 32K em uma única GPU em vez de quatro nós, com tempos de passo 5x mais rápidos. O modelo aluno, destilado do Llama 3.1 8B Instruct para 3.2B parâmetros, mantém a maior parte da precisão em benchmarks como BoolQ e HellaSwag e permanece dentro de nove pontos no MMLU.
Fonte: Hugging Face blog —
original
