PesquisaHardware e Inferência 🇺🇸 27.07.2026 18:04

Novo relatório técnico do DeepSeek-V3: como o co-design hardware-software permite treinamento de baixo custo de modelos grandes

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Um novo artigo técnico da equipe DeepSeek, com o CEO Wenfeng Liang como coautor, explora o co-design de modelos conscientes de hardware para reduzir os custos de treinamento de LLMs. Usando o DeepSeek-V3 treinado em 2048 GPUs NVIDIA H800 como estudo de caso, o artigo detalha inovações em eficiência de memória (MLA), computação esparsa (DeepSeekMoE), treinamento FP8 e roteamento consciente de interconexão.
O artigo de 14 páginas, 'Desafios de Escala e Reflexões sobre Hardware para Arquiteturas de IA', analisa como as restrições de hardware (memória, computação, largura de banda de interconexão) moldam o design de LLMs. O DeepSeek-V3 usa Atenção Latente Multi-cabeça (MLA) para comprimir o cache KV para 70 KB por token, contra 516 KB do LLaMA-3.1 405B. Sua arquitetura DeepSeekMoE ativa apenas 37B de 671B parâmetros por token, reduzindo os FLOPs por token para aproximadamente 250 GFLOPS, contra 394 do Qwen2.5-72B e 2448 do LLaMA-3.1 405B. O modelo emprega treinamento de precisão mista FP8 e comunicação de baixa precisão LogFMT, reduzindo o volume de comunicação em 50% em relação ao BF16. Para mitigar a largura de banda reduzida do NVLink do NVIDIA H800 (400 GB/s vs. 900 GB/s no H100), o roteamento consciente de nós agrupa 256 especialistas em 8 grupos locais de nós, limitando cada token a no máximo 4 nós. O artigo defende uma interconexão unificada de expansão e distribuição, além de coprocessadores de comunicação dedicados.
Fonte: Synced — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas