моделей. Результат — увеличение пропускной способности обучения в 3,4–3,7 раза и снижение использования GPU-памяти на 29–32% при тонкой настройке MoE-моделей по сравнению с нативным Transformers v5 с использованием того же API from_pretrained() — достаточно изменить одну строку импорта, не меняя остальной код. NeMoAutoModelForCausalLM является подклассом AutoModelForCausalLM, поэтому любой код, работающий с HF-моделями, работает и с AutoModel. Для популярных MoE-архитектур (Qwen3, NVIDIA Nemotron, GPT-OSS, DeepSeek V3) NeMo AutoModel использует специальные реализации с вниманием TransformerEngine, свёрнутыми линейными слоями и кастомными экспертными ядрами. Для остальных моделей применяется оптимизированный fallback с кернелами Liger. Измерения производительности показали: при полной тонкой настройке модели Nemotron 3 Ultra 550B A55B на 16 узлах (128 GPU) NeMo AutoModel достигла 815 токенов/с на GPU и 293 TFLOP/s на GPU при пиковом потреблении памяти 58,2 ГБ, тогда как Transformers v5 не смог запуститься при таком масштабе из-за нехватки памяти. На одноузловых тестах с 8 GPU для Qwen3-30B-A3B NeMo AutoModel показала 11 340 токенов/с на GPU (против 3 075 у v5, ускорение 3,69x) и пиковое потребление 48,1 ГБ (на 29% меньше, чем 68,2 ГБ у v5). Для Nemotron 3 Nano 30B A3B результаты: 15 421 токен/с (против 4 583, ускорение 3,36x) и 42,5 ГБ памяти (на 32% меньше, чем 62,1 ГБ у v5). Ускорение достигается за счёт трёх факторов: экспертный параллелизм снижает давление на память, DeepEP объединяет коммуникацию с вычислениями, а ядра TransformerEngine ускоряют основные операции.