ModellerAraştırma 🇨🇳 30.07.2026 13:02

GPT-2'den Kimi K3'e: Yedi Yılda Ölçek 22.580 Kat Büyüdü, Ana Mimari İplik Bir "Bellek İşletim Sistemi" İnşa Ediyor

Moonshot AIMoonshot AI
Büyük modellerin GPT-2'den Kimi K3'ye teknik evrimi, yapay zeka mimarisinin "her şeyi hatırlama"dan "seçici bellek"e nasıl geçtiğini gösteriyor. KV Cache, üretim verimliliğini çözerken, Linear Attention daha verimli uzun vadeli bellek arayışında; DeltaNet ve Kimi Linear, modellerin bilgiyi güncellemeyi, unutmayı ve yönetmeyi öğrenmesini sağlıyor. Kimi K3, 2,8 trilyon parametreyle yaklaşık 22.580 GPT-2 modeline eşdeğer.
Makale, yedi yıllık mimari evrimi inceliyor, büyük modellerin ölçek büyümesinin arkasındaki teknik değişiklikleri ve Kimi K3'ün yeni bellek mekanizmalarıyla geleneksel Transformer sınırlamalarını nasıl aştığını analiz ediyor. GPT-2, yalnızca kod çözücü mimarisi ve token ile konum yerleştirmeleri kullandı. KV Cache, anahtar-değer vektörlerini depolayarak yeniden hesaplamayı önlüyor. Doğrusal Dikkat, q ve k'ye öznitelik haritaları (örneğin, ELU+1) uygulayarak KV vektörlerini sabit boyutlu bir durum matrisine sıkıştırıyor. DeltaNet, Doğrusal Dikkat'i delta kuralı ile genişleterek belleği seçici olarak güncelliyor ve bilgi karışmasını azaltıyor. Geçitli DeltaNet, Mamba'nın geçitleme mekanizmasını delta kuralı ile birleştirerek bir bozunma parametresi α ekliyor. Kimi Lineer, Geçitli DeltaNet'i kanal bazında ince taneli geçitleme ile geliştiriyor. Kimi K3'ün dil omurgasında, her biri üç Kimi Delta Dikkat katmanı ve bir Çok Başlıklı Gizli Dikkat katmanı içeren 23 makro döngü bulunuyor. İlk katmanda yoğun FFN, diğer tüm katmanlarda ise Gizli MoE kullanıyor. Kimi K3'te toplam 898 uzman var; iki paylaşımlı uzman her tokeni işlerken, yönlendirici seçici kalan 896 uzmandan token başına 16 uzman seçiyor.
Kaynak: InfoQ 中国 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler