OOM-verslaan in PyTorch: Gigantische grafieken trainen op een gewone GPU
Een ontwikkelaar heeft Disk Sparse Adam (DSA) gecreëerd, een out-of-core optimizer voor PyTorch die optimizer-momenttoestanden via mmap naar de schijf verplaatst, waardoor het geheugengebruik voor het trainen van grote sparse modellen drastisch wordt verminderd. Dit maakt trainen op consumenten-GPU's en zelfs gratis Google Colab mogelijk, met een benchmark die nul VRAM-overhead aantoont op een miljoen entiteiten.
Disk Sparse Adam
Habr — хаб ИИ08.08 · 16:02
