Новый технический отчет DeepSeek-V3: как совместное проектирование аппаратного и программного обеспечения позволяет снизить затраты на обучение больших моделей

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Новый технический отчет команды DeepSeek, соавтором которого стал генеральный директор Вэньфэн Лян, исследует совместное проектирование моделей с учетом аппаратного обеспечения для снижения затрат на обучение больших языковых моделей. На примере DeepSeek-V3, обученной на 2048 графических процессорах NVIDIA H800, в статье подробно описаны инновации в эффективности использования памяти (MLA), разреженных вычислениях (DeepSeekMoE), обучении с использованием FP8 и маршрутизации с учетом межсоединений.
14-страничный документ «Проблемы масштабирования и размышления об аппаратном обеспечении для AI-архитектур» анализирует, как аппаратные ограничения (память, вычислительная мощность, пропускная способность межсоединений) влияют на дизайн больших языковых моделей (Large Language Models, LLM). DeepSeek-V3 использует многоголовое латентное внимание (Multi-head Latent Attention, MLA) для сжатия
Показать ещё ↓
Источник: Synced — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости