ИсследованияOpen Source 🇺🇸 27.07.2026 10:04

Ускорение тонкой настройки трансформеров с NVIDIA NeMo AutoModel

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA представила NeMo AutoModel — открытую библиотеку для масштабного создания кастомных генеративных ИИ-моделей на основе Transformers v5. Она добавляет экспертный параллелизм (Expert Parallelism), DeepEP и ядра TransformerEngine, что даёт ускорение обучения в 3.4–3.7 раза и снижение потребления GPU-памяти на 29–32% при тонкой настройке MoE-моделей без изменения API.
NVIDIA NeMo AutoModel — это открытая библиотека, входящая в фреймворк NVIDIA NeMo для создания кастомных генеративных ИИ-моделей в масштабе. Она строится поверх Transformers v5, добавляя экспертный параллелизм (Expert Parallelism), DeepEP fused all-to-all dispatch и ядра TransformerEngine, а также использует динамическую загрузку весов v5 для применения этих оптимизаций к широкому кругу семейств
Показать ещё ↓
Сокращения
MoE = Mixture of Experts — смесь экспертов
GPU = Graphics Processing Unit — графический процессор
API = Application Programming Interface — интерфейс прикладного программирования
FSDP = Fully Sharded Data Parallelism — полностью сегментированный параллелизм данных
MTP = Multi-Token Prediction — множественное предсказание токенов
Источник: Hugging Face blog — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости