연구모델 🇺🇸 27.07.2026 18:04

New DeepSeek-V3 Technical Report: How Hardware-Software Codesign Enables Low-Cost Training of Large Models

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
A new 14-page technical report from the DeepSeek-V3 team, co-authored by DeepSeek CEO Wenfeng Liang, has been released. The document analyzes the scaling challenges of large language models and the role of hardware infrastructure, proposing solutions based on joint design of models and hardware for cost-effective training and inference.
Команда DeepSeek-V3 опубликовала новый технический отчет, в котором соавтором указан генеральный директор компании Вэньфэн Лян. 14-страничный документ посвящен проблемам масштабирования больших языковых моделей (Large Language Models, LLM) и отражению аппаратных ограничений. В отличие от предыдущей публикации, описывавшей архитектуру V3, новый отчет фокусируется на взаимосвязи между разработкой моделей и их аппаратным обеспечением. DeepSeek-V3 обучалась на кластере из 2048 графических процессоров NVIDIA H800 и служит примером того, как учет характеристик «железа» позволяет преодолеть узкие места — нехватку памяти, вычислительной эффективности и пропускной способности интерконнекта. Среди ключевых архитектурных решений — механизм Multi-head Latent Attention (MLA), сжимающий кэш ключей-значений до 70 КБ на токен (против 516 КБ у LLaMA-3.1 405B и 327 КБ у Qwen-2.5 72B). Экономия вычислений достигается за счет разреженной архитектуры DeepSeekMoE: модель с 671 млрд параметров активирует лишь 37 млрд на токен, что требует около 250 гигафлопс (GFLOPS) на токен против 394 у Qwen-2.5 72B и 2448 у LLaMA-3.1 405B. Для ускорения инференса используется двойная микробатчевая архитектура, перекрывающая коммуникацию вычислениями, а также разделение на этапы prefill и decode. DeepSeek-V3 стала первой публично известной большой моделью, обученной с использованием FP8 смешанной точности, что снизило вычислительные затраты. Для межузлового обмена данные сжимаются с помощью FP8 (LogFMT), что вдвое сокращает объем коммуникации. Из-за регуляторных ограничений NVIDIA H800 имеет вдвое меньшую пропускную способность NVLink (400 гигабайт в секунду (ГБ/с) против 900), поэтому DeepSeek применил «узел-ориентированную маршрутизацию» экспертов MoE, группируя экспертов в 8 групп по 32 на одном узле и ограничивая число узлов-получателей для каждого токена четырьмя. В документе также обсуждаются перспективные направления: объединение scale-up и scale-out в единую шину (UB), внедрение специализированных сопроцессоров для сетевого трафика, динамическое управление пропускной способностью NVLink/PCIe и использование топологии Multi-Plane Fat-Tree.
출처: Synced — 원문
관련 게시물 ↓
새로운 뉴스