Как сделать дистилляцию знаний достаточно дешевой для масштабирования
В новой статье от компании Multiverse Computing представлена эффективная офлайн-дистилляция знаний с кэшированием top-K логитов и объединенной чанковой KL-потерей, что снижает использование видеопамяти более чем в 15 раз и позволяет проводить дистилляцию длинного контекста на одном графическом процессоре. Эти методы значительно сокращают затраты на обучение, делая крупномасштабные эксперименты по дистилляции практичными.
Дистилляция знаний (knowledge distillation), при которой меньшая модель-«студент» обучается воспроизводить поведение более крупной модели-«учителя», — это стандартный приём сжатия больших языковых моделей (LLM, large language model). Современные открытые LLM, такие как Kimi-K3 с 2,8 триллиона параметров, требуют около 3 ТБ видеопамяти (VRAM), что делает сжатие моделей необходимостью. В статье
Показать ещё ↓
Источник: Hugging Face blog —
оригинал
