Ускорение тонкой настройки трансформеров с NVIDIA NeMo AutoModel
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA представила NeMo AutoModel — открытую библиотеку для масштабного создания кастомных генеративных ИИ-моделей на основе Transformers v5. Она добавляет экспертный параллелизм (Expert Parallelism), DeepEP и ядра TransformerEngine, что даёт ускорение обучения в 3.4–3.7 раза и снижение потребления GPU-памяти на 29–32% при тонкой настройке MoE-моделей без изменения API.
NVIDIA NeMo AutoModel — это открытая библиотека, входящая в фреймворк NVIDIA NeMo для создания кастомных генеративных ИИ-моделей в масштабе. Она строится поверх Transformers v5, добавляя экспертный параллелизм (Expert Parallelism), DeepEP fused all-to-all dispatch и ядра TransformerEngine, а также использует динамическую загрузку весов v5 для применения этих оптимизаций к широкому кругу семейств
Показать ещё ↓
- Сокращения
- MoE = Mixture of Experts — смесь экспертов
- GPU = Graphics Processing Unit — графический процессор
- API = Application Programming Interface — интерфейс прикладного программирования
- FSDP = Fully Sharded Data Parallelism — полностью сегментированный параллелизм данных
- MTP = Multi-Token Prediction — множественное предсказание токенов
Источник: Hugging Face blog —
оригинал
