من GPT-2 إلى Kimi K3: نمو المقياس بمقدار 22,580 مرة في سبع سنوات، الخيط المعماري الرئيسي يبني "نظام تشغيل للذاكرة"
Moonshot AI
يظهر التطور التقني للنماذج الكبيرة من GPT-2 إلى Kimi K3 كيف تنتقل بنية الذكاء الاصطناعي من "تذكر كل شيء" إلى "ذاكرة انتقائية". يحل KV Cache مشكلة كفاءة التوليد، ويستكشف Linear Attention ذاكرة طويلة المدى أكثر كفاءة، وتمكن DeltaNet و Kimi Linear النماذج من تعلم كيفية التحديث والنسيان وإدارة المعلومات. يحتوي Kimi K3 على 2.8 تريليون معلمة، أي ما يعادل حوالي 22,580 نموذج GPT-2.
تتتبع المقالة سبع سنوات من تطور البنية، لتحليل التغييرات التقنية الكامنة وراء نمو حجم النماذج الكبيرة وكيفية اختراق Kimi K3 لقيود Transformer التقليدية بآليات ذاكرة جديدة. استخدم GPT-2 بنية تعتمد على وحدة فك التشفير فقط مع تضمين الرموز والمواضع. يقوم KV Cache بتخزين متجهات المفتاح-القيمة لتجنب إعادة الحساب. يطبق Linear Attention خرائط الميزات (مثل ELU+1) على q و k، لضغط متجهات KV في مصفوفة حالة ثابتة الحجم. يوسع DeltaNet تقنية Linear Attention بقاعدة دلتا لتحديث الذاكرة بشكل انتقائي، مما يقلل من تداخل المعلومات. يجمع Gated DeltaNet بين بوابة Mamba وقاعدة دلتا، مضيفًا معامل اضمحلال α. يحسن Kimi Linear من Gated DeltaNet من خلال بوابة دقيقة على مستوى القنوات. يحتوي العمود الفقري اللغوي لـ Kimi K3 على 23 حلقة كبيرة، تحتوي كل منها على ثلاث طبقات Kimi Delta Attention وطبقة واحدة من Multi-Head Latent Attention. يستخدم شبكة FFN كثيفة في الطبقة الأولى و Latent MoE في جميع الطبقات الأخرى. يمتلك Kimi K3 إجمالي 898 خبيرًا؛ يعالج خبيران مشتركان كل رمز، ويختار الموجه 16 خبيرًا لكل رمز من بين الـ 896 المتبقية.
المصدر: InfoQ 中国 —
الأصلي
