मॉडलशोध 🇨🇳 30.07.2026 13:02

GPT-2 से Kimi K3 तक: सात वर्षों में स्केल 22,580 गुना बढ़ा, मुख्य आर्किटेक्चर थ्रेड 'मेमोरी ऑपरेटिंग सिस्टम' बनाता है

Moonshot AIMoonshot AI
GPT-2 से Kimi K3 तक बड़े मॉडलों का तकनीकी विकास दिखाता है कि कैसे AI आर्किटेक्चर 'सब कुछ याद रखने' से 'चयनात्मक स्मृति' की ओर बढ़ता है। KV Cache जनरेशन दक्षता हल करता है, Linear Attention अधिक कुशल दीर्घकालिक स्मृति की खोज करता है, DeltaNet और Kimi Linear मॉडल को जानकारी को अपडेट करना, भूलना और प्रबंधित करना सीखने में सक्षम बनाते हैं। Kimi K3 में 2.8 ट्रिलियन पैरामीटर हैं, जो लगभग 22,580 GPT-2 मॉडल के बराबर है।
यह लेख सात वर्षों के आर्किटेक्चर विकास का पता लगाता है, बड़े मॉडलों के पैमाने के विकास के पीछे के तकनीकी बदलावों का विश्लेषण करता है और कैसे Kimi K3 नए मेमोरी मैकेनिज्म के साथ पारंपरिक ट्रांसफॉर्मर की सीमाओं को तोड़ता है। GPT-2 ने टोकन और पोजीशन एम्बेडिंग के साथ एक डिकोडर-ओनली आर्किटेक्चर का उपयोग किया। KV Cache पुनर्गणना से बचने के लिए की-वैल्यू वेक्टरों को संग्रहीत करता है। Linear Attention q और k पर फीचर मैप (जैसे ELU+1) लागू करता है, KV वेक्टरों को एक निश्चित आकार के स्टेट मैट्रिक्स में संपीड़ित करता है। DeltaNet एक डेल्टा नियम के साथ Linear Attention का विस्तार करता है ताकि मेमोरी को चुनिंदा रूप से अपडेट किया जा सके, जिससे सूचना हस्तक्षेप कम हो। Gated DeltaNet Mamba के गेटिंग को डेल्टा नियम के साथ जोड़ता है, एक डिके पैरामीटर α जोड़ता है। Kimi Linear बारीक-दाने वाले चैनल-वार गेटिंग के साथ Gated DeltaNet में सुधार करता है। Kimi K3 के लैंग्वेज बैकबोन में 23 मैक्रो-लूप हैं, जिनमें से प्रत्येक में तीन Kimi Delta Attention लेयर और एक Multi-Head Latent Attention लेयर है। यह पहली लेयर में डेंस FFN और अन्य सभी में Latent MoE का उपयोग करता है। Kimi K3 के कुल 898 एक्सपर्ट हैं; दो साझा एक्सपर्ट प्रत्येक टोकन को प्रोसेस करते हैं, और राउटर शेष 896 में से प्रति टोकन 16 एक्सपर्ट चुनता है।
स्रोत: InfoQ 中国 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार