AraştırmaAçık Kaynak 🇷🇺 27.07.2026 20:04

Writing a Decoder-Only Transformer for LLM from Scratch in Python

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
The author of a series of articles describes in detail the implementation of a transformer block for a small decoder-only LLM using the PyTorch framework. Components covered include: Multi-Head Attention with masking, Feed Forward Network with GELU, normalization layer, and residual connections. The article explains the difference from the original architecture: pre-normalization (Pre-LN) is used instead of post-normalization for training stability.
Yazar Vladimir, lisanslı bir metnin filigranlanması görevi örneğinde, decoder-only LLM için bir transformatör bloğu uyguluyor. Transformatörün, Google'ın "Attention Is All You Need" makalesindeki mimari olduğunu ve burada dizilerin dikkat mekanizması aracılığıyla paralel olarak işlendiğini açıklıyor. Multi-Head Attention'ın temelinde üç projeksiyon matrisi Q, K, V bulunuyor. İlk aşamada token benzerliği (dikkat matrisi) hesaplanırken, ikinci aşamada token içerikleri bulunan ağırlıklara göre karıştırılıyor. Verimlilik için tüm dikkat başlıkları, tek bir büyük doğrusal projeksiyon üzerinden uygulanıyor. Attention'ın ardından, GELU aktivasyonu ve dropout içeren bir Feed Forward Network kullanılıyor. Transformatörün birleştirilmesi, normalizasyon (Pre-LN) ve artık bağlantılar içeriyor. Ayrıca decoder için bir gelecek maskesi (causal mask) ekleniyor. Genel olarak blok, LLM oluşturma, eğitim ve metin üretiminde kullanıma hazır hale geliyor.
Kaynak: Habr — хаб NLP — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler