ForschungModelle 🇺🇸 27.07.2026 18:04

Neuer DeepSeek-V3 Technischer Bericht: Wie Hardware-Software-Co-Design kostengünstiges Training großer Modelle ermöglicht

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Ein neuer 14-seitiger technischer Bericht des DeepSeek-V3 Teams, verfasst unter Mitwirkung von DeepSeek CEO Wenfeng Liang, wurde veröffentlicht. Das Dokument analysiert die Skalierungsherausforderungen großer Sprachmodelle und die Rolle der Hardware-Infrastruktur und schlägt Lösungen vor, die auf einem gemeinsamen Design von Modellen und Hardware für kosteneffizientes Training und Inferenz basieren.
Команда DeepSeek-V3 выпустила новый технический доклад, в котором соавтором указан гендиректор компании Вэньфэн Лян. 14-страничный документ посвящён проблемам масштабирования больших языковых моделей (LLM) и отражению аппаратных ограничений. В отличие от предыдущей публикации, описывавшей архитектуру V3, новый отчёт фокусируется на взаимосвязи между разработкой моделей и их аппаратным обеспечением. DeepSeek-V3 обучалась на кластере из 2048 NVIDIA H800 GPU и служит примером того, как учёт характеристик «железа» позволяет преодолеть узкие места — нехватку памяти, вычислительной эффективности и пропускной способности интерконнекта. Среди ключевых архитектурных решений — механизм Multi-head Latent Attention (MLA), сжимающий кэш ключей-значений до 70 КБ на токен (против 516 КБ у LLaMA-3.1 405B и 327 КБ у Qwen-2.5 72B). Экономия вычислений достигается за счёт разреженной архитектуры DeepSeekMoE: модель с 671 млрд параметров активирует лишь 37 млрд на токен, что требует около 250 GFLOPS на токен против 394 у Qwen-2.5 72B и 2448 у LLaMA-3.1 405B. Для ускорения инференса используется двойная микробатчевая архитектура, перекрывающая коммуникацию вычислениями, а также разделение на этапы prefill и decode. DeepSeek-V3 стала первой публично известной большой моделью, обученной с использованием FP8 смешанной точности, что снизило вычислительные затраты. Для межузлового обмена данные сжимаются с помощью FP8 (LogFMT), что вдвое сокращает объём коммуникации. Из-за регуляторных ограничений NVIDIA H800 имеет вдвое меньшую пропускную способность NVLink (400 ГБ/с против 900), поэтому DeepSeek применил «узел-ориентированную маршрутизацию» экспертов MoE, группируя экспертов в 8 групп по 32 на одном узле и ограничивая число узлов-получателей для каждого токена четырьмя. В документе также обсуждаются перспективные направления: объединение scale-up и scale-out в единую шину (UB), внедрение специализированных сопроцессоров для сетевого трафика, динамическое управление пропускной способностью NVLink/PCIe и использование топологии Multi-Plane Fat-Tree.
Quelle: Synced — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten