NVIDIA NeMo AutoModel ускоряет тонкую настройку MoE в 3,7 раза с помощью экспертного параллелизма и DeepEP
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA представила NeMo AutoModel — открытую библиотеку, построенную на основе Hugging Face Transformers v5, которая обеспечивает в 3,4–3,7 раза более высокую пропускную способность обучения и на 29–32% меньшее использование памяти GPU для моделей MoE за счет экспертного параллелизма, объединенной диспетчеризации all-to-all DeepEP и ядер TransformerEngine — при использовании того же API from_pretrained() с изменением только импорта.
NVIDIA NeMo AutoModel — это открытая библиотека в составе фреймворка NVIDIA NeMo, предназначенная для создания custom генеративных моделей искусственного интеллекта в масштабе. Она построена на основе Transformers (версия 5), добавляя экспертный параллелизм (Expert Parallelism, EP), коммуникационную библиотеку DeepEP с объединённой операцией «все-всем» (fused all-to-all dispatch) и ядра
Показать ещё ↓
Источник: Hugging Face blog —
оригинал
