연구하드웨어 및 추론 🇺🇸 27.07.2026 18:04

새로운 DeepSeek-V3 기술 보고서: 하드웨어-소프트웨어 공동 설계가 대규모 모델의 저비용 학습을 가능하게 하는 방법

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
DeepSeek 팀의 새로운 기술 논문(CEO Liang Wenfeng이 공동 저자로 참여)에서는 LLM 학습 비용을 줄이기 위한 하드웨어 인식 모델 공동 설계를 탐구합니다. 2048개의 NVIDIA H800 GPU에서 학습된 DeepSeek-V3를 사례 연구로 사용하여, 메모리 효율성(MLA), 희소 연산(DeepSeekMoE), FP8 학습, 상호 연결 인식 라우팅의 혁신을 자세히 설명합니다.
14페이지 분량의 논문 'Scaling Challenges and Reflections on Hardware for AI Architectures'는 하드웨어 제약(메모리, 연산, 상호 연결 대역폭)이 LLM 설계를 어떻게 형성하는지 분석합니다. DeepSeek-V3는 MLA(Multi-head Latent Attention)를 사용하여 KV 캐시를 토큰당 70KB로 압축하는 반면, LLaMA-3.1 405B는 516KB입니다. DeepSeekMoE 아키텍처는 토큰당 671B 파라미터 중 37B만 활성화하여 토큰당 FLOPs를 약 250 GFLOPS로 줄이는 반면, Qwen2.5-72B는 394, LLaMA-3.1 405B는 2448입니다. 이 모델은 FP8 혼합 정밀도 훈련과 LogFMT 저정밀도 통신을 사용하여 BF16 대비 통신량을 50% 절감합니다. NVIDIA H800의 감소된 NVLink 대역폭(H100의 900GB/s 대비 400GB/s)을 완화하기 위해, 노드 인식 라우팅은 256개의 전문가를 8개의 노드 로컬 그룹으로 그룹화하여 각 토큰이 최대 4개 노드로 제한되도록 합니다. 논문은 통합된 스케일업/스케일아웃 상호 연결과 전용 통신 코프로세서를 옹호합니다.
출처: Synced — 원문
관련 게시물 ↓
새로운 뉴스