Nuevo informe técnico de DeepSeek-V3: cómo el codiseño hardware-software permite el entrenamiento de bajo costo de modelos grandes
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
Se ha publicado un nuevo informe técnico de 14 páginas del equipo de DeepSeek-V3, coescrito por el CEO de DeepSeek, Wenfeng Liang. El documento analiza los desafíos de escalado de los grandes modelos de lenguaje y el papel de la infraestructura de hardware, proponiendo soluciones basadas en el diseño conjunto de modelos y hardware para un entrenamiento e inferencia rentables.
El equipo de DeepSeek-V3 ha publicado un nuevo informe técnico en el que figura como coautor el CEO de la compañía, Wenfeng Liang. El documento, de 14 páginas, aborda los problemas de escalado de los grandes modelos de lenguaje (LLM, por sus siglas en inglés) y refleja las limitaciones del hardware. A diferencia de la publicación anterior, que describía la arquitectura de V3, el nuevo informe se centra en la relación entre el desarrollo de modelos y su hardware. DeepSeek-V3 se entrenó en un clúster de 2048 GPU NVIDIA H800 y sirve como ejemplo de cómo tener en cuenta las características del hardware permite superar cuellos de botella como la falta de memoria, la eficiencia computacional y el ancho de banda de interconexión. Entre las decisiones arquitectónicas clave se encuentra el mecanismo Multi-head Latent Attention, o MLA, que comprime la caché de clave-valor a 70 KB por token (frente a los 516 KB de LLaMA-3.1 405B y los 327 KB de Qwen-2.5 72B). El ahorro computacional se logra gracias a la arquitectura dispersa DeepSeekMoE: el modelo, con 671 mil millones de parámetros, activa solo 37 mil millones por token, lo que requiere unos 250 GFLOPS por token, frente a los 394 de Qwen-2.5 72B y los 2448 de LLaMA-3.1 405B. Para acelerar la inferencia, se utiliza una arquitectura de micro-lotes dobles que superpone la comunicación con los cálculos, así como una división en fases de prefill y decode. DeepSeek-V3 se convirtió en el primer modelo grande públicamente conocido entrenado con precisión mixta FP8, lo que redujo los costos computacionales. Para el intercambio entre nodos, los datos se comprimen mediante FP8, concretamente LogFMT, lo que reduce a la mitad el volumen de comunicación. Debido a las restricciones regulatorias, la NVIDIA H800 tiene la mitad del ancho de banda NVLink (400 GB/s frente a 900), por lo que DeepSeek aplicó un "enrutamiento orientado a nodos" para los expertos MoE, agrupando a los expertos en 8 grupos de 32 en un mismo nodo y limitando a cuatro el número de nodos receptores por token. El documento también analiza direcciones prometedoras: la unificación de scale-up y scale-out en un único bus (UB), la incorporación de coprocesadores especializados para el tráfico de red, la gestión dinámica del ancho de banda de NVLink y PCIe, y el uso de la topología Multi-Plane Fat-Tree.
Fuente: Synced —
original
