Mengalahkan OOM di PyTorch: Melatih Grafik Raksasa di GPU Biasa
Seorang pengembang telah menciptakan Disk Sparse Adam (DSA), sebuah optimizer out-of-core untuk PyTorch yang memindahkan state momen optimizer ke disk melalui mmap, secara drastis mengurangi penggunaan memori untuk melatih model sparse yang besar. Ini memungkinkan pelatihan pada GPU konsumen dan bahkan Google Colab gratis, dengan benchmark menunjukkan overhead VRAM nol pada satu juta entitas.
Disk Sparse Adam
Habr — хаб ИИ08.08 · 16:02
