शोधओपन सोर्स 🇷🇺 27.07.2026 20:04

Writing a Decoder-Only Transformer for LLM from Scratch in Python

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
The author of a series of articles describes in detail the implementation of a transformer block for a small decoder-only LLM using the PyTorch framework. Components covered include: Multi-Head Attention with masking, Feed Forward Network with GELU, normalization layer, and residual connections. The article explains the difference from the original architecture: pre-normalization (Pre-LN) is used instead of post-normalization for training stability.
लेखक व्लादिमीर लाइसेंस प्राप्त टेक्स्ट के वॉटरमार्किंग कार्य के उदाहरण पर डिकोडर-ओनली एलएलएम के लिए एक ट्रांसफॉर्मर ब्लॉक लागू करता है। वह बताते हैं कि ट्रांसफॉर्मर गूगल के पेपर 'अटेंशन इज़ ऑल यू नीड' की एक आर्किटेक्चर है, जहां अनुक्रम को अटेंशन मैकेनिज्म की मदद से समानांतर रूप में प्रोसेस किया जाता है। मल्टी-हेड अटेंशन के मूल में तीन प्रोजेक्शन मैट्रिसेज क्यू, के, वी हैं। पहले चरण में टोकनों की समानता (अटेंशन मैट्रिक्स) की गणना की जाती है, दूसरे में प्राप्त वेट्स के अनुसार टोकनों की सामग्री मिश्रित की जाती है। दक्षता के लिए सभी अटेंशन हेड्स एक बड़े लीनियर प्रोजेक्शन के माध्यम से कार्यान्वित किए जाते हैं। अटेंशन के बाद जीईएलयू एक्टिवेशन और ड्रॉपआउट के साथ फीड फॉरवर्ड नेटवर्क लगाया जाता है। ट्रांसफॉर्मर के निर्माण में नॉर्मलाइजेशन (प्री-एलएन) और रेसिडुअल कनेक्शन शामिल हैं। डिकोडर के लिए एक कॉज़ल मास्क (भविष्य का मास्क) भी जोड़ा जाता है। कुल मिलाकर, ब्लॉक एलएलएम के निर्माण, प्रशिक्षण और टेक्स्ट जनरेशन में उपयोग के लिए तैयार है।
स्रोत: Habr — хаб NLP — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार