PesquisaModelos 🇺🇸 27.07.2026 18:04

Novo Relatório Técnico do DeepSeek-V3: Como o Codesign de Hardware e Software Possibilita o Treinamento de Baixo Custo de Grandes Modelos

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Um novo relatório técnico de 14 páginas da equipe do DeepSeek-V3, coautorado pelo CEO da DeepSeek, Wenfeng Liang, foi publicado. O documento analisa os desafios de escalabilidade de grandes modelos de linguagem e o papel da infraestrutura de hardware, propondo soluções baseadas no design conjunto de modelos e hardware para treinamento e inferência econômicos.
A equipe da DeepSeek-V3 publicou um novo relatório técnico, no qual o CEO da empresa, Wenfeng Liang, é coautor. O documento de 14 páginas aborda os desafios de escalonamento de grandes modelos de linguagem (large language models, LLMs) e o reflexo das limitações de hardware. Diferentemente da publicação anterior, que descrevia a arquitetura do V3, o novo relatório foca na inter-relação entre o desenvolvimento de modelos e seu hardware. A DeepSeek-V3 foi treinada em um cluster com 2048 GPUs NVIDIA H800 e serve como exemplo de como considerar as características do hardware permite superar gargalos — falta de memória, eficiência computacional e largura de banda de interconexão. Entre as principais decisões arquitetônicas está o mecanismo de Multi-head Latent Attention (MLA), que comprime o cache de chave-valor em até 70 KB por token (contra 516 KB do LLaMA-3.1 405B e 327 KB do Qwen-2.5 72B). A economia computacional é obtida por meio da arquitetura esparsa DeepSeekMoE: o modelo com 671 bilhões de parâmetros ativa apenas 37 bilhões por token, exigindo aproximadamente 250 GFLOPS por token, contra 394 do Qwen-2.5 72B e 2448 do LLaMA-3.1 405B. Para acelerar a inferência, utiliza-se uma arquitetura de duplo microbatch que sobrepõe comunicação com computação, além da divisão em estágios de prefill e decode. A DeepSeek-V3 tornou-se o primeiro grande modelo publicamente conhecido a ser treinado com precisão mista FP8, o que reduziu os custos computacionais. Para a troca de dados entre nós, os dados são comprimidos usando FP8 (LogFMT), reduzindo pela metade o volume de comunicação. Devido a restrições regulatórias, a NVIDIA H800 tem metade da largura de banda NVLink (400 GB/s contra 900), portanto a DeepSeek aplicou um "roteamento orientado a nós" para os especialistas MoE, agrupando os especialistas em 8 grupos de 32 em um único nó e limitando o número de nós receptores para cada token a quatro. O documento também discute direções promissoras: unificação de scale-up e scale-out em um único barramento (UB), introdução de coprocessadores especializados para tráfego de rede, gerenciamento dinâmico da largura de banda NVLink/PCIe e uso da topologia Multi-Plane Fat-Tree.
Fonte: Synced — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas