모델연구 🇺🇸 27.07.2026 18:04

대규모 언어 모델 아키텍처 비교: DeepSeek V3에서 OLMo 2까지

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka가 최신 LLM 아키텍처를 비교합니다. DeepSeek V3는 Multi-Head Latent Attention과 Mixture-of-Experts를, Allen Institute for AI의 OLMo 2는 Post-Norm과 QK-norm을 사용합니다. 이 글은 Grouped-Query Attention과 다양한 정규화 방식 같은 주요 아키텍처 결정을 다룹니다.
세바스찬 라슈카(Sebastian Raschka)는 자신의 글에서 현대 대규모 언어 모델의 아키텍처적 특징을 분석하며, DeepSeek V3/R1, OLMo 2 등을 비교합니다. DeepSeek V3는 키와 값을 저차원 공간으로 압축하여 KV 캐시 메모리를 절약하는 멀티헤드 잠재 어텐션(Multi-Head Latent Attention, MLA)과 256개의 전문가 중 9개만 활성화(공유 전문가 1개와 라우터가 선택한 8개)되는 혼합 전문가(Mixture-of-Experts, MoE)를 사용하여, 총 6710억 개의 파라미터를 가지고도 단계당 370억 개의 파라미터만 사용합니다. 반면, Allen Institute for AI의 OLMo 2는 전통적인 멀티헤드 어텐션을 사용하되, 어텐션과 피드포워드 네트워크 계층 후에 RMSNorm(Post-Norm)을 적용하고 QK-정규화(QK-norm)를 통해 훈련을 안정화합니다. 또한 이 글은 다른 모델에서 사용되는 멀티헤드 어텐션의 대안으로 그룹화된 쿼리 어텐션(Grouped-Query Attention)도 언급합니다.
출처: Sebastian Raschka — 원문
관련 게시물 ↓
새로운 뉴스