모델연구 🇨🇳 30.07.2026 13:02

GPT-2에서 Kimi K3까지: 7년 만에 규모 22,580배 성장, 주요 아키텍처 스레드는 '메모리 운영 체제' 구축

Moonshot AIMoonshot AI
GPT-2에서 Kimi K3로 이어지는 대규모 모델의 기술적 진화는 AI 아키텍처가 '모든 것을 기억하는 것'에서 '선택적 기억'으로 이동하는 방식을 보여줍니다. KV 캐시는 생성 효율성을 해결하고, 선형 주의(Linear Attention)는 더 효율적인 장기 기억을 탐구하며, DeltaNet과 Kimi Linear는 모델이 정보를 업데이트, 망각 및 관리하는 법을 학습할 수 있게 합니다. Kimi K3는 2.8조 개의 파라미터를 가지며, 이는 약 22,580개의 GPT-2 모델에 해당합니다.
이 글은 7년간의 아키텍처 진화를 추적하며, 대규모 모델의 규모 성장 이면의 기술적 변화와 Kimi K3가 새로운 메모리 메커니즘을 통해 기존 Transformer의 한계를 어떻게 극복하는지 분석합니다. GPT-2는 토큰 임베딩과 위치 임베딩이 있는 디코더 전용 아키텍처를 사용했습니다. KV 캐시는 키-값 벡터를 저장하여 재계산을 방지합니다. 선형 어텐션(Linear Attention)은 q와 k에 특징 맵(예: ELU+1)을 적용하여 KV 벡터를 고정 크기 상태 행렬로 압축합니다. 델타넷(DeltaNet)은 델타 규칙을 사용하여 선형 어텐션을 확장, 메모리를 선택적으로 업데이트하여 정보 간섭을 줄입니다. 게이티드 델타넷(Gated DeltaNet)은 맘바(Mamba)의 게이팅과 델타 규칙을 결합하고 감쇠 파라미터 α를 추가합니다. Kimi Linear는 세분화된 채널별 게이팅으로 게이티드 델타넷을 개선합니다. Kimi K3의 언어 백본은 23개의 매크로 루프로 구성되며, 각 루프는 3개의 Kimi 델타 어텐션 레이어와 1개의 멀티 헤드 잠재 어텐션 레이어를 포함합니다. 첫 번째 레이어는 밀집 FFN을 사용하고 나머지 모든 레이어는 잠재 MoE를 사용합니다. Kimi K3는 총 898개의 전문가를 보유하며, 2개의 공유 전문가가 모든 토큰을 처리하고, 라우터가 나머지 896개 중에서 토큰당 16개의 전문가를 선택합니다.
출처: InfoQ 中国 — 원문
관련 게시물 ↓
새로운 뉴스