InvestigaciónCódigo Abierto 🇷🇺 27.07.2026 20:04

Escribiendo un Transformer Solo Decodificador para LLM desde Cero en Python

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
El autor de una serie de artículos describe en detalle la implementación de un bloque transformer para un LLM pequeño solo decodificador utilizando el framework PyTorch. Los componentes cubiertos incluyen: atención de múltiples cabezas enmascarada, red de avance con GELU, capa de normalización y conexiones residuales. El artículo explica la diferencia respecto a la arquitectura original: se utiliza pre-normalización (Pre-LN) en lugar de post-normalización para la estabilidad del entrenamiento.
El autor Vladimir, utilizando el ejemplo de una tarea de marcas de agua para texto licenciado, implementa un bloque transformer para un LLM solo decodificador. Explica que el transformer es una arquitectura del artículo de Google "Attention Is All You Need", donde una secuencia se procesa en paralelo mediante un mecanismo de atención. La atención multi-cabeza se basa en tres matrices de proyección: Q, K, V. En el primer paso, se calcula la similitud entre tokens (matriz de atención), y en el segundo, el contenido de los tokens se mezcla según los pesos encontrados. Para mayor eficiencia, todas las cabezas de atención se implementan a través de una única proyección lineal grande. Tras la atención, se aplica una red feed-forward con activación GELU y dropout. La construcción del transformer incluye normalización (Pre-LN) y conexiones residuales. Además, se utiliza una máscara causal para el decodificador. En conjunto, el bloque está listo para su uso en el ensamblaje de un LLM, entrenamiento y generación de texto.
Fuente: Habr — хаб NLP — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas