Новый технический отчет DeepSeek-V3: как совместное проектирование аппаратного и программного обеспечения позволяет снизить затраты на обучение больших моделей
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
Новый технический отчет команды DeepSeek, соавтором которого стал генеральный директор Вэньфэн Лян, исследует совместное проектирование моделей с учетом аппаратного обеспечения для снижения затрат на обучение больших языковых моделей. На примере DeepSeek-V3, обученной на 2048 графических процессорах NVIDIA H800, в статье подробно описаны инновации в эффективности использования памяти (MLA), разреженных вычислениях (DeepSeekMoE), обучении с использованием FP8 и маршрутизации с учетом межсоединений.
14-страничный документ «Проблемы масштабирования и размышления об аппаратном обеспечении для AI-архитектур» анализирует, как аппаратные ограничения (память, вычислительная мощность, пропускная способность межсоединений) влияют на дизайн больших языковых моделей (Large Language Models, LLM). DeepSeek-V3 использует многоголовое латентное внимание (Multi-head Latent Attention, MLA) для сжатия
Показать ещё ↓
Источник: Synced —
оригинал
