RechercheModèles 🇷🇺 11.08.2026 00:02

Mise à l'échelle de l'entraînement des LLM : d'une seule puce à un centre de données. Chapitre 4. Entraînement d'un Transformer

Ce chapitre passe en revue quatre types de parallélisme pour entraîner des transformers sur plusieurs accélérateurs : le parallélisme de données, le parallélisme de données entièrement fragmenté (FSDP), le parallélisme tensoriel et le parallélisme par pipeline. Il discute de leurs avantages, inconvénients et du moment où les combiner, en soulignant l'importance d'atteindre une performance limitée par le calcul pour l'évolutivité.
L'article explique comment entraîner un transformeur de manière efficace et à grande échelle. Il introduit une notation pour les dimensions du modèle (D, F, B, T, L) et le matériel (C, W, X, Y, Z). Les quatre types de parallélisme sont décrits : le parallélisme de données divise le lot entre les accélérateurs, nécessitant AllReduce pour l'agrégation des gradients, et est efficace lorsque le modèle tient dans un seul accélérateur. FSDP (ZeRO) fragmente les poids du modèle, les gradients et les états de l'optimiseur, en utilisant AllGather et ReduceScatter, et est limité par le calcul avec de petites tailles de lots. Le parallélisme tensoriel fragmente les matrices de poids, échangeant les activations, et est mieux combiné avec FSDP pour réduire la taille des activations par rapport aux poids. Le parallélisme pipeline divise le modèle en couches, minimisant le transfert de données mais introduisant des « bulles de pipeline », qui peuvent être atténuées par le micro-batching ou le chevauchement des calculs. L'article note que la combinaison FSDP+TP est presque toujours limitée par le calcul, et que le pipeline est courant pour les clusters de GPU. Il conclut que l'objectif est de passer à l'échelle tout en gérant les surcharges.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches