Superando OOM no PyTorch: Treinando Gráficos Gigantes em uma GPU Comum
Um desenvolvedor criou o Disk Sparse Adam (DSA), um otimizador out-of-core para PyTorch que move os estados de momento do otimizador para o disco via mmap, reduzindo drasticamente o uso de memória para treinar grandes modelos esparsos. Isso permite treinar em GPUs de consumo e até no Google Colab gratuito, com benchmark mostrando zero overhead de VRAM em um milhão de entidades.
Disk Sparse Adam
Habr — хаб ИИ08.08 · 16:02
