Побеждаем OOM в PyTorch: обучение гигантских графов на обычном GPU
Разработчик создал Disk Sparse Adam (DSA) — оптимизатор вне ядра для PyTorch, который перемещает состояния моментов оптимизатора на диск через mmap, значительно снижая использование памяти при обучении больших разреженных моделей. Это позволяет обучать модели на потребительских GPU и даже в бесплатном Google Colab; бенчмарк показывает нулевую нагрузку на видеопамять при обучении на миллионе сущностей.
В статье представлен Disk Sparse Adam (DSA) — новый оптимизатор для PyTorch, работающий вне оперативной памяти (out-of-core) и предназначенный для обучения крупных разреженных моделей, таких как эмбеддинги графов знаний с миллионами узлов, на потребительских GPU. Стандартный torch.optim.SparseAdam хранит состояния первого и второго моментов в памяти, что для модели с 10 миллионами сущностей и
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
