Feinabstimmung von Transformatoren mit NVIDIA NeMo AutoModel beschleunigen
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA hat NeMo AutoModel vorgestellt, eine Open-Source-Bibliothek zur großflächigen Erstellung benutzerdefinierter generativer KI-Modelle auf Basis von Transformatoren v5. Sie fügt Expert Parallelism, DeepEP und TransformerEngine-Kernel hinzu und erzielt Trainingsbeschleunigungen von 3,4 bis 3,7-fach sowie eine Reduzierung des GPU-Speicherverbrauchs um 29–32% bei der Feinabstimmung von MoE-Modellen ohne API-Änderungen.
NVIDIA NeMo AutoModel ist eine Open-Source-Bibliothek innerhalb des NVIDIA-NeMo-Frameworks, die zur Erstellung benutzerdefinierter generativer KI-Modelle im großen Maßstab dient. Sie baut auf Transformers v5 auf und fügt Expert Parallelism, DeepEP fused all-to-all dispatch sowie TransformerEngine-Kernel hinzu. Zudem nutzt sie das dynamische Gewichteladen von v5, um diese Optimierungen auf eine breite Palette von Modellfamilien anzuwenden. Das Ergebnis ist eine 3,4- bis 3,7-fache Steigerung des Trainingsdurchsatzes und eine Reduzierung des GPU-Speicherverbrauchs um 29 bis 32 Prozent beim Feintuning von MoE-Modellen im Vergleich zu nativen Transformers v5 mit derselben from_pretrained()-API – es genügt, eine einzige Importzeile zu ändern, ohne den restlichen Code anzupassen. NeMoAutoModelForCausalLM ist eine Unterklasse von AutoModelForCausalLM, sodass jeder Code, der mit Hugging-Face-Modellen funktioniert, auch mit AutoModel funktioniert. Für gängige MoE-Architekturen wie Qwen3, NVIDIA Nemotron, GPT-OSS und DeepSeek V3 verwendet NeMo AutoModel spezielle Implementierungen mit TransformerEngine-Aufmerksamkeit, gefalteten linearen Schichten und benutzerdefinierten Expert-Kernen. Für andere Modelle kommt ein optimierter Fallback mit Liger-Kerneln zum Einsatz. Leistungsmessungen ergaben: Beim vollständigen Feintuning des Modells Nemotron 3 Ultra 550B A55B auf 16 Knoten (128 GPUs) erreichte NeMo AutoModel 815 Tokens pro Sekunde pro GPU und 293 TeraFLOP pro Sekunde pro GPU bei einem Spitzenspeicherverbrauch von 58,2 Gigabyte, während Transformers v5 aufgrund von Speichermangel in diesem Maßstab nicht gestartet werden konnte. In Ein-Knoten-Tests mit 8 GPUs für Qwen3-30B-A3B erzielte NeMo AutoModel 11.340 Tokens pro Sekunde pro GPU (gegenüber 3.075 bei v5, eine Beschleunigung um das 3,69-Fache) und einen Spitzenspeicher von 48,1 Gigabyte (29 Prozent weniger als 68,2 Gigabyte bei v5). Für Nemotron 3 Nano 30B A3B lauten die Ergebnisse: 15.421 Tokens pro Sekunde (gegenüber 4.583, Beschleunigung um das 3,36-Fache) und 42,5 Gigabyte Speicher (32 Prozent weniger als 62,1 Gigabyte bei v5). Die Beschleunigung wird durch drei Faktoren erreicht: Expert Parallelism reduziert den Speicherdruck, DeepEP vereint Kommunikation mit Berechnung und die TransformerEngine-Kernel beschleunigen die Kernoperationen.
Quelle: Hugging Face blog —
Original
