Побеждаем OOM в PyTorch: обучение гигантских графов на обычном GPU
Разработчик создал Disk Sparse Adam (DSA) — оптимизатор вне ядра для PyTorch, который перемещает состояния моментов оптимизатора на диск через mmap, значительно снижая использование памяти при обучении больших разреженных моделей. Это позволяет обучать модели на потребительских GPU и даже в бесплатном Google Colab; бенчмарк показывает нулевую нагрузку на видеопамять при обучении на миллионе сущностей.
Habr — хаб ИИ08.08 · 16:02
