Cómo superar el desbordamiento de memoria en PyTorch: entrenar grafos gigantes en una GPU común
Un desarrollador ha creado Disk Sparse Adam (DSA), un optimizador fuera de núcleo para PyTorch que mueve los estados de momento del optimizador al disco mediante mmap, reduciendo drásticamente el uso de memoria para entrenar modelos dispersos grandes. Esto permite entrenar en GPUs de consumo e incluso en Google Colab gratuito, con un benchmark que muestra un uso de memoria de VRAM nulo en un millón de entidades.
Disk Sparse Adam
Habr — хаб ИИ08.08 · 16:02
