モデル研究 🇨🇳 30.07.2026 13:02

GPT-2からKimi K3へ:7年でスケールが22,580倍に拡大、メインアーキテクチャが「メモリオペレーティングシステム」を構築

Moonshot AIMoonshot AI
大規模モデルの技術進化は、GPT-2からKimi K3に至るまで、AIアーキテクチャが「全てを記憶する」から「選択的記憶」へと移行する様子を示している。KV Cacheは生成効率を解決し、Linear Attentionはより効率的な長期記憶を探求し、DeltaNetとKimi Linearによりモデルは情報の更新、忘却、管理を学習できるようになる。Kimi K3は2.8兆パラメータを有し、これは約22,580個のGPT-2モデルに相当する。
本記事は7年間のアーキテクチャの進化をたどり、大規模モデルのスケール成長の背後にある技術的変化と、Kimi K3が新しいメモリ機構によって従来のTransformerの限界をどのように打破するかを分析しています。GPT-2はトークン埋め込みと位置埋め込みを用いたデコーダのみのアーキテクチャを使用していました。KV Cacheはキーと値のベクトルを保存し、再計算を回避します。Linear Attentionでは、特徴マップ(例:ELU+1)をqとkに適用し、KVベクトルを固定サイズの状態行列に圧縮します。DeltaNetはデルタルールを用いてLinear Attentionを拡張し、メモリを選択的に更新することで情報干渉を低減します。Gated DeltaNetはMambaのゲーティングとデルタルールを組み合わせ、減衰パラメータαを追加します。Kimi LinearはGated DeltaNetを改良し、チャネル単位のきめ細かいゲーティングを実現します。Kimi K3の言語バックボーンは23個のマクロループを持ち、各ループは3層のKimi Delta Attentionと1層のMulti-Head Latent Attentionで構成されています。最初の層では高密度なフィードフォワードネットワーク(FFN)を、その他の層ではLatent Mixture of Experts(MoE)を使用します。Kimi K3は合計898個のエキスパートを持ち、2つの共有エキスパートがすべてのトークンを処理し、ルーターが残りの896個からトークンごとに16個のエキスパートを選択します。
出典: InfoQ 中国 — 原文
関連記事 ↓
新着ニュース