Writing a Decoder-Only Transformer for LLM from Scratch in Python
Google/DeepMind
OpenAI
Meta
The author of a series of articles describes in detail the implementation of a transformer block for a small decoder-only LLM using the PyTorch framework. Components covered include: Multi-Head Attention with masking, Feed Forward Network with GELU, normalization layer, and residual connections. The article explains the difference from the original architecture: pre-normalization (Pre-LN) is used instead of post-normalization for training stability.
लेखक व्लादिमीर लाइसेंस प्राप्त टेक्स्ट के वॉटरमार्किंग कार्य के उदाहरण पर डिकोडर-ओनली एलएलएम के लिए एक ट्रांसफॉर्मर ब्लॉक लागू करता है। वह बताते हैं कि ट्रांसफॉर्मर गूगल के पेपर 'अटेंशन इज़ ऑल यू नीड' की एक आर्किटेक्चर है, जहां अनुक्रम को अटेंशन मैकेनिज्म की मदद से समानांतर रूप में प्रोसेस किया जाता है। मल्टी-हेड अटेंशन के मूल में तीन प्रोजेक्शन मैट्रिसेज क्यू, के, वी हैं। पहले चरण में टोकनों की समानता (अटेंशन मैट्रिक्स) की गणना की जाती है, दूसरे में प्राप्त वेट्स के अनुसार टोकनों की सामग्री मिश्रित की जाती है। दक्षता के लिए सभी अटेंशन हेड्स एक बड़े लीनियर प्रोजेक्शन के माध्यम से कार्यान्वित किए जाते हैं। अटेंशन के बाद जीईएलयू एक्टिवेशन और ड्रॉपआउट के साथ फीड फॉरवर्ड नेटवर्क लगाया जाता है। ट्रांसफॉर्मर के निर्माण में नॉर्मलाइजेशन (प्री-एलएन) और रेसिडुअल कनेक्शन शामिल हैं। डिकोडर के लिए एक कॉज़ल मास्क (भविष्य का मास्क) भी जोड़ा जाता है। कुल मिलाकर, ब्लॉक एलएलएम के निर्माण, प्रशिक्षण और टेक्स्ट जनरेशन में उपयोग के लिए तैयार है।
स्रोत: Habr — хаб NLP —
मूल
