От GPT-2 до Kimi K3: масштаб вырос в 22 580 раз за семь лет, основная архитектурная нить строит «операционную систему памяти»
Moonshot AI
Техническая эволюция больших моделей от GPT-2 до Kimi K3 показывает, как архитектура ИИ переходит от «запоминания всего» к «избирательной памяти». KV Cache решает проблему эффективности генерации, Linear Attention исследует более эффективную долговременную память, DeltaNet и Kimi Linear позволяют моделям учиться обновлять, забывать и управлять информацией. Kimi K3 имеет 2,8 триллиона параметров, что эквивалентно примерно 22 580 моделям GPT-2.
Статья прослеживает семилетнюю эволюцию архитектур, анализируя технические изменения, стоящие за ростом масштаба больших моделей, и то, как Kimi K3 преодолевает ограничения традиционных Transformer с помощью новых механизмов памяти. GPT-2 использовал архитектуру только с декодером, токеновые и позиционные эмбеддинги. KV Cache (кэш ключей-значений) хранит векторы ключей и значений, чтобы избежать
Показать ещё ↓
Источник: InfoQ 中国 —
оригинал
