128-мерными векторами занимает дополнительно около 10,24 ГБ, что часто приводит к ошибкам нехватки памяти CUDA (CUDA out-of-memory). DSA вместо этого хранит эти матрицы моментов на диске в виде бинарных файлов и отображает их в память с помощью механизма mmap операционной системы, считывая и записывая состояния только для активного батча на каждом шаге оптимизации. Оптимизатор спроектирован как готовая замена для стандартных пайплайнов PyTorch и поддерживает как евклидово пространство, так и гиперболическое (модель Пуанкаре). Автор сообщает, что потребление памяти под состояния оптимизатора снижается с гигабайтов до мегабайтов, а тест на Kaggle с 1 миллионом сущностей показал нулевые накладные расходы по видеопамяти (0,00 МБ VRAM) и пропускную способность 134 212 примеров в секунду. DSA доступен на GitHub под лицензией MIT, среди ограничений — необходимость NVMe SSD для достижения максимальной производительности и совместимость только с разреженными градиентами, например, получаемыми из torch.nn.Embedding или EmbeddingBag.