Дискретное квантование: следующий рубеж в сжатии нейронных сетей
В статье рассматривается переход от классических методов квантования к дискретному квантованию, при котором веса ограничены небольшим набором значений (бинарным, троичным). Особое внимание уделяется семейству моделей Bonsai 27B от PrismML, использующему бинарные и троичные версии Qwen 3.6 27B, что позволяет достичь сжатия до 14 раз с сохранением значительной части возможностей исходной модели. Автор тестирует троичную версию, отмечая более быстрый вывод, но неравномерное падение производительности на сложных задачах, и обсуждает практические последствия запуска больших моделей на потребительском оборудовании.
Статья начинается с обсуждения эволюции квантования нейронных сетей, перехода от традиционных форматов с плавающей запятой к целочисленным типам, таким как INT8 и INT4, а затем к дискретному квантованию с бинарными (1-битными) и троичными (1.58-битными) весами. Этот подход радикально уменьшает размер модели и позволяет развертывание на потребительском оборудовании. Семейство Bonsai 27B от
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
