RisetSumber Terbuka 🇷🇺 27.07.2026 20:04

Menulis Transformer Hanya Dekoder untuk LLM dari Nol dengan Python

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
Penulis dari serangkaian artikel menjelaskan secara detail implementasi blok transformer untuk LLM kecil hanya dekoder menggunakan kerangka PyTorch. Komponen yang dibahas meliputi: masked Multi-Head Attention, Feed Forward Network dengan GELU, lapisan normalisasi, dan koneksi residual. Artikel ini menjelaskan perbedaan dari arsitektur asli: pre-normalisasi (Pre-LN) digunakan sebagai pengganti post-normalisasi untuk stabilitas pelatihan.
Penulis Vladimir, dengan menggunakan contoh tugas watermarking untuk teks berlisensi, mengimplementasikan blok transformer untuk LLM decoder-only. Ia menjelaskan bahwa transformer adalah arsitektur dari makalah Google "Attention Is All You Need," di mana sebuah urutan diproses secara paralel menggunakan mekanisme attention. Multi-Head Attention didasarkan pada tiga matriks proyeksi: Q, K, V. Pada langkah pertama, kemiripan token dihitung (matriks attention), dan pada langkah kedua, konten token dicampur sesuai dengan bobot yang ditemukan. Demi efisiensi, semua kepala attention diimplementasikan melalui satu proyeksi linier besar. Setelah attention, diterapkan Feed Forward Network dengan aktivasi GELU dan dropout. Pembangunan transformer mencakup normalisasi (Pre-LN) dan koneksi residual. Selain itu, mask kausal digunakan untuk decoder. Secara keseluruhan, blok ini siap digunakan dalam merakit LLM, pelatihan, dan pembuatan teks.
Sumber: Habr — хаб NLP — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru