«Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss» решается проблема высокой стоимости дистилляции за счёт офлайн-кэширования top-K логитов учителя, что избавляет от необходимости держать модель-учителя в памяти. Также авторы предлагают объединённую (fused) чанковую функцию потерь на основе дивергенции Кульбака-Лейблера (KL, Kullback-Leibler), которая вычисляет потери порциями, избегая построения полной матрицы «словарь × последовательность». Это позволяет снизить пиковое потребление видеопамяти с 250 ГБ до 128 ГБ на одном GPU H200, что даёт возможность проводить дистилляцию с контекстом 32K на одном GPU вместо четырёх узлов, при этом шаги обучения выполняются в 5 раз быстрее. Модель-студент, полученная путём дистилляции Llama 3.1 8B Instruct до 3,2 млрд параметров, сохраняет большую часть точности на таких бенчмарках, как BoolQ и HellaSwag, и отстаёт не более чем на девять пунктов по MMLU.