Nghiên cứuMô hình 🇺🇸 27.07.2026 18:04

New DeepSeek-V3 Technical Report: How Hardware-Software Codesign Enables Low-Cost Training of Large Models

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
A new 14-page technical report from the DeepSeek-V3 team, co-authored by DeepSeek CEO Wenfeng Liang, has been released. The document analyzes the scaling challenges of large language models and the role of hardware infrastructure, proposing solutions based on joint design of models and hardware for cost-effective training and inference.
Команда DeepSeek-V3 выпустила новый технический доклад, в котором соавтором указан гендиректор компании Вэньфэн Лян. 14-страничный документ посвящён проблемам масштабирования больших языковых моделей (Large Language Model, LLM) и отражению аппаратных ограничений. В отличие от предыдущей публикации, описывавшей архитектуру V3, новый отчёт фокусируется на взаимосвязи между разработкой моделей и их аппаратным обеспечением. DeepSeek-V3 обучалась на кластере из 2048 NVIDIA H800 GPU и служит примером того, как учёт характеристик «железа» позволяет преодолеть узкие места — нехватку памяти, вычислительной эффективности и пропускной способности интерконнекта. Среди ключевых архитектурных решений — механизм Multi-head Latent Attention (MLA), сжимающий кэш ключей-значений до 70 КБ на токен (против 516 КБ у LLaMA-3.1 405B и 327 КБ у Qwen-2.5 72B). Экономия вычислений достигается за счёт разреженной архитектуры DeepSeekMoE: модель с 671 млрд параметров активирует лишь 37 млрд на токен, что требует около 250 GFLOPS на токен против 394 у Qwen-2.5 72B и 2448 у LLaMA-3.1 405B. Для ускорения инференса используется двойная микробатчевая архитектура, перекрывающая коммуникацию вычислениями, а также разделение на этапы prefill и decode. DeepSeek-V3 стала первой публично известной большой моделью, обученной с использованием FP8 смешанной точности, что снизило вычислительные затраты. Для межузлового обмена данные сжимаются с помощью FP8 (LogFMT), что вдвое сокращает объём коммуникации. Из-за регуляторных ограничений NVIDIA H800 имеет вдвое меньшую пропускную способность NVLink (400 ГБ/с против 900), поэтому DeepSeek применил «узел-ориентированную маршрутизацию» экспертов MoE, группируя экспертов в 8 групп по 32 на одном узле и ограничивая число узлов-получателей для каждого токена четырьмя. В документе также обсуждаются перспективные направления: объединение scale-up и scale-out в единую шину (UB), внедрение специализированных сопроцессоров для сетевого трафика, динамическое управление пропускной способностью NVLink/PCIe и использование топологии Multi-Plane Fat-Tree.
Nguồn: Synced — bản gốc
Bài viết liên quan trước đây ↓
Tin mới