Forschung RSS

Forschung 🇨🇳

Global-Batch-Lastverteilung: Fast kostenloses Mittagessen zur Verbesserung des MoE-LLM-Trainings

Alibaba Qwen schlägt eine Global-Batch-Lastverteilungsmethode für Mixture-of-Experts (MoE)-Modelle vor, die die Einschränkungen der Mikrobatch-Ebene überwindet, indem die Häufigkeiten der Expertenauswahl über alle Mikrobatches hinweg synchronisiert werden. Experimente zeigen verbesserte Leistung und Spezialisierung der Experten in verschiedenen Modellgrößen und Datenkonfigurationen.

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen28.07 · 16:03
Forschung 🇺🇸

IEEE startet Online-Schulungskurs zu Large Language Models

Die IEEE hat ein Online-Programm aus fünf Kursen mit dem Titel "Large Language Models Demystified" eingeführt, um technischen Fachkräften zu helfen, die LLM-Technik zu meistern. Das Programm behandelt Transformer-Architekturen, Modelloptimierung, RAG, RLHF und Bereitstellung und zielt darauf ab, die Kluft zwischen KI-Nutzern und -Entwicklern zu überbrücken.

IEEEIEEE PyTorchPyTorch
IEEE Spectrum AI28.07 · 16:03
Aktuelle Nachrichten