模型研究 🇨🇳 30.07.2026 13:02

从GPT-2到Kimi K3:规模七年增长22580倍,主流架构构建“记忆操作系统”

Moonshot AIMoonshot AI
从GPT-2到Kimi K3的技术演变展示了AI架构如何从“记住一切”转向“选择性记忆”。KV缓存解决了生成效率问题,线性注意力探索更高效的长期记忆,DeltaNet和Kimi Linear使模型学会更新、遗忘和管理信息。Kimi K3拥有2.8万亿参数,相当于约22580个GPT-2模型。
本文追溯了七年来的架构演变,分析了大型模型规模增长背后的技术变化,以及Kimi K3如何通过新的记忆机制突破传统Transformer的局限。GPT-2采用了仅解码器的架构,包含词元嵌入和位置嵌入。KV缓存存储键值向量以避免重复计算。线性注意力将特征映射(例如ELU+1)应用于q和k,将KV向量压缩成固定大小的状态矩阵。DeltaNet通过增量规则扩展了线性注意力,以选择性更新记忆,减少了信息干扰。门控DeltaNet结合了Mamba的门控机制和增量规则,并引入了衰减参数α。Kimi Linear通过细粒度的通道级门控改进门控DeltaNet。Kimi K3的语言主干包含23个宏循环,每个循环包含三个Kimi Delta注意力层和一个多头潜注意力层。它在前馈网络的第一层使用密集FFN,其余层使用潜混合专家。Kimi K3总共拥有898个专家;两个共享专家处理每个词元,路由器从剩余896个专家中为每个词元选择16个专家。
来源: InfoQ 中国 — 原文
我们之前关于此话题的帖子 ↓
最新新闻