Écrire un Transformer Décodeur-Only pour un LLM à partir de zéro en Python
L'auteur d'une série d'articles décrit en détail l'implémentation d'un bloc transformer pour un petit LLM décodeur-only utilisant le framework PyTorch. Les composants couverts incluent : l'attention multi-têtes avec masquage, le réseau feed-forward avec GELU, la couche de normalisation et les connexions résiduelles. L'article explique la différence par rapport à l'architecture originale : la pré-normalisation (Pre-LN) est utilisée à la place de la post-normalisation pour la stabilité de l'entraînement.
Google/DeepMind
OpenAI
Meta

