OnderzoekOpen Source 🇷🇺 27.07.2026 20:04

Het schrijven van een Decoder-Only Transformer voor LLM vanuit het niets in Python

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
De auteur van een reeks artikelen beschrijft in detail de implementatie van een transformerblok voor een kleine decoder-only LLM met behulp van het PyTorch-framework. Onderdelen die aan bod komen zijn onder andere: gemaskeerde Multi-Head Attention, Feed Forward Netwerk met GELU, normalisatielaag en residuverbindingen. Het artikel legt het verschil met de oorspronkelijke architectuur uit: pre-normalisatie (Pre-LN) wordt gebruikt in plaats van post-normalisatie voor trainingsstabiliteit.
Auteur Vladimir implementeert aan de hand van een voorbeeld van een watermerktaak voor gelicentieerde tekst een transformerblok voor een decoder-only LLM. Hij legt uit dat de transformer een architectuur is uit het Google-artikel 'Attention Is All You Need', waarbij een sequentie parallel wordt verwerkt met behulp van een aandachtsmechanisme. Multi-Head Attention is gebaseerd op drie projectiematrices: Q, K, V. In de eerste stap wordt de gelijkenis van tokens berekend (aandachtsmatrix), en in de tweede stap wordt de tokeninhoud gemengd volgens de gevonden gewichten. Voor efficiëntie worden alle aandachtskoppen geïmplementeerd via een enkele grote lineaire projectie. Na de aandacht wordt een Feed Forward Network met GELU-activatie en dropout toegepast. Het bouwen van de transformer omvat normalisatie (Pre-LN) en residuale verbindingen. Daarnaast wordt een causale masker gebruikt voor de decoder. Over het geheel genomen is het blok klaar voor gebruik bij het assembleren van een LLM, training en tekstgeneratie.
Bron: Habr — хаб NLP — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws